Codex 上线了一个跨设备任务迁移功能,叫 Handoff。你在笔记本上用 Codex 写代码写到一半,合上盖子之前,可以把正在进行的任务连同代码状态一起迁移到远程服务...
正文内容概括Codex 上线了 Handoff 跨设备任务迁移功能,支持通过自然语言将完整 Git 状态和代码任务在本地与远程主机间迁移。
核心观点提炼常规快讯,保留列表
今天这期 AIWatch 早报围绕「product、Agent、成本优化」展开,先用一段导语把当天主线收束起来,再按今日头条、推荐精选和补充速览逐条介绍。聚焦 30 · 关注 0 · 跟进 7。
如果只有 20 分钟,先读:Anthropic 宣布美国出口管制解除后,重新上线 Claude Fable 5 模型,并分享事件时间线、安全改进及行业越狱评估框架 → Z.ai 发布了 GLM-5.2 开源模型,具备 1M 上下文窗口和两种推理模式,专为智能体和长周期编码任务设计 → OpenAI 收购 Ona,为 Codex agent 提供持久化安全云工作空间,支持其在无人值守时持续执行企业级任务。
今天的主线不是孤立新闻,而是「product、Agent、成本优化」在不同层面的同步推进。
正文内容概括Codex 上线了 Handoff 跨设备任务迁移功能,支持通过自然语言将完整 Git 状态和代码任务在本地与远程主机间迁移。
核心观点提炼常规快讯,保留列表
正文内容概括美国政府以国家安全为由发布出口管制指令,要求暂停所有外国国民(包括外国籍员工)对 Anthropic 的 Fable 5 和 Mythos 5 模型的访问。Anthropic 被迫立即对所有客户禁用这两个模型,其他 Claude 模型不受影响。公司认为这是误解,正努力恢复访问。 核心观点: 1. 美国政府出口管制指令要求暂停所有外国国民对 Fable 5 和 Mythos 5 的访问,包括 Anthropic 的外国籍员工。 2. Anthropic 被迫立即对所有客户禁用 Fable 5 和 Mythos 5,其他 Claude 模型不受影响。
核心观点提炼高信息密度,值得细读
正文内容概括开发者分享通过MCP连接网页版ChatGPT读取本地文件,变相获得双倍Codex额度的配置方法。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 收购 Ona,为 Codex 智能体构建持久化安全云工作空间,解决复杂任务无人值守时中断的问题。Ona 提供受控环境,使智能体能运行命令、保存上下文并在笔记本关闭后恢复工作,满足企业级安全需求。此举将 Codex 从对话工具扩展为可执行测试、修复、重构等长时任务的托管执行层,为开发者提供更可靠的自动化基础设施。 核心观点: 1. Codex 周活用户已达 500 万,增长 400%,显示智能体需求快速扩张。 2. Ona 提供持久化云工作空间,使智能体能在笔记本关闭后继续运行命令并恢复上下文。 3. 收购目标为企业场景:支持在自有云边界内部署智能体,提供限定凭证、审查跟踪与可审计活动。
核心观点提炼高信息密度,值得细读
正文内容概括Anthropic 发布面向科学家的 AI 工作台 Claude Science(Beta),集成 60+ 预配置技能与数据库(如 UniProt、PDB、Ensembl),支持基因组学、蛋白质组学等科研任务。该平台将分散工具整合为统一环境,产出可审计、可复现的科研产物(含 3D 蛋白结构、化学结构等),并管理本地或云端计算资源(HPC、Modal)。对开发者/研究者而言,它降低了多工具切换与计算管理的复杂度,并支持通过 NVIDIA BioNeMo 连接生命科学模型。 核心观点: 1. Claude Science 内置 reviewer agent,可自动检查引用、计算错误并自我修正。 2. 平台支持 fork 会话以并行比较不同实验路径,且上下文在运行会话中持续保留。 3. 通过 NVIDIA BioNeMo Agent Toolkit 原生连接 Evo 2、Boltz-2、OpenFold3 等生命科学模型。
核心观点提炼高信息密度,值得细读
正文内容概括Anthropic 发布了 Claude Sonnet 5,这是其最具智能体能力的 Sonnet 模型。该模型能够自主制定计划,并使用浏览器和终端等工具,其自主运行水平接近数月前需要更大、更昂贵模型才能达到的程度。这对开发者意味着可以以更低成本实现更复杂的自动化任务。 核心观点: 1. Claude Sonnet 5 具备自主规划能力,并能使用浏览器和终端等工具。 2. 该模型的自主运行效率接近此前需要更大、更昂贵模型才能达到的水平。
核心观点提炼高信息密度,值得细读
正文内容概括Google DeepMind 启动欧洲机器人加速器,为 15 家初创公司提供 Gemini Robotics 模型及 AI 技术栈支持。
核心观点提炼常规快讯,保留列表
正文内容概括Anthropic 发布面向科研者的 AI 工作台 Claude Science,定位为科研领域的 Claude Code。它不训练新模型,而是将现有 Claude 模型(含 Opus 4.8)与 60 多个科学数据库(涵盖基因组学、蛋白质组学等)及多 Agent 系统集成到统一界面,支持自然语言驱动的文献查询、代码生成、图表复现和本地/集群运算。早期用户案例显示其在基因组浏览器搭建、RNA-seq 污染发现、多 Agent 文献综述等方面有显著效率提升。对开发者而言,Claude Science 展示了将通用 LLM 通过 Workflow 和 Agent 架构深度嵌入特定行业操作层的产品化路径。 核心观点: 1. Claude Science 不训练新模型,而是通过集成 60+ 科学数据库和多 Agent 系统将现有模型包装为科研平台。 2. 每张图表附带生成代码、运行环境、自然语言描述和完整对话记录,支持自然语言指令修改图表。 3. 支持本地运算(macOS/Linux)和 SSH 连接 HPC 集群,敏感数据可留本地,仅发送上下文信息给 Claude。
核心观点提炼高信息密度,值得细读
正文内容概括GLM 5.2 成为 Vals Index、Vibe Code Bench 和 Terminal Bench 上新的开源权重 SOTA,综合排名第五,紧追 Opus 4.7。
核心观点提炼常规快讯,保留列表
正文内容概括DeepSeek 招聘 Agent Harness 研究员,定义 Model + Harness = Agent 技术路线。
核心观点提炼常规快讯,保留列表
正文内容概括OpenRouter 发布 Fusion API,通过混合模型实现高性价比智能,挑战前沿模型在成本-准确率曲线上的主导地位。
核心观点提炼常规快讯,保留列表
正文内容概括Anthropic 为 Claude Code 推出七种指令定制方法,包括 CLAUDE.md、规则、技能、子代理、钩子、输出风格和系统提示追加。每种方法在加载时机、持久性(压缩行为)和上下文成本上各有不同,帮助开发者精细控制 AI 行为。开发者可根据指令的重要性、作用范围和成本选择合适方法,例如将通用规范放在 CLAUDE.md,将特定约束设为规则,将流程性任务封装为技能。 核心观点: 1. CLAUDE.md 根目录文件始终加载且高上下文成本,建议控制在 200 行以内并指定负责人。 2. 子代理在独立上下文窗口中运行,仅返回最终消息摘要,主会话上下文成本为零。 3. 钩子绕过压缩机制,适合确定性自动化任务如运行 linter 或发送 Slack 通知。
核心观点提炼高信息密度,值得细读
正文内容概括谷歌DeepMind发布Gemini 3.5 Flash,新增原生计算机使用能力。该内置工具允许开发者构建可跨浏览器、移动和桌面界面进行视觉识别与操作的智能体,扩展了AI在自动化交互场景的应用边界。 核心观点: 1. Gemini 3.5 Flash新增原生计算机使用工具,支持开发者构建跨浏览器、移动和桌面界面的智能体。
核心观点提炼高信息密度,值得细读
正文内容概括OpenAI 与 Broadcom 联合推出专为大语言模型推理优化的定制芯片 Jalapeño,旨在提升 AI 系统的性能、效率和可扩展性。该芯片针对 LLM 推理场景进行专门设计,有望降低推理成本并提高响应速度,对开发者和研究者而言,意味着未来可能获得更高效、更低成本的 AI 推理基础设施。
核心观点提炼重磅首发或硬核洞察
正文内容概括OpenAI 预览了下一代模型 GPT-5.6 Sol,该模型在编程、科学和网络安全方面能力更强,并配备了最先进的安全栈。对开发者而言,这意味着更强的代码生成与科学推理能力,同时安全机制得到升级。
核心观点提炼重磅首发或硬核洞察
正文内容概括Z.ai 发布了 GLM-5.2 开源模型,具备 1M 上下文窗口和两种推理模式(High 和 Max),专为智能体和长周期编码任务设计。该模型在编码和智能体任务上有显著改进,已上线 Venice 平台,对 Pro 用户完全私有可用。 核心观点: 1. GLM-5.2 提供两种推理模式:GLM-5.2 (max) 和 GLM-5.2 (high),分别对应极限推理和高效推理。 2. 模型支持 1M 上下文窗口,专为长周期智能体编码任务设计。
核心观点提炼高信息密度,值得细读
正文内容概括Anthropic 推出 Claude Tag,一种在 Slack 中通过 @Claude 标签让团队协作使用 AI 的新方式。它支持多用户共享上下文、异步任务和主动提醒,管理员可精细控制工具和数据访问权限。目前以 beta 形式面向 Claude Enterprise 和 Team 客户开放,旨在将 Claude Code 的协作模式扩展到更广泛的团队场景。 核心观点: 1. Claude Tag 在 Slack 中实现多用户共享同一 Claude 实例,支持上下文记忆和异步任务。 2. Anthropic 内部产品团队 65% 的代码由内部版 Claude Tag 生成。 3. Claude Tag 基于 Opus 4.8 模型,支持管理员设置 token 限额和操作日志。
核心观点提炼高信息密度,值得细读
正文内容概括Anthropic 发布 Claude Managed Agents,一套用于构建和部署生产级智能体的可组合 API。该服务通过将智能体大脑(推理)与双手(代码执行)解耦,解决了从原型到生产过程中的基础设施难题,如托管、会话管理、凭证安全和可观测性。它提供预配置的智能体、执行环境和持久化会话,使团队能将开发周期从数月缩短至数天,专注于上下文管理和领域专业知识。 核心观点: 1. Managed Agents 通过解耦推理与代码执行,将凭证存储在独立 Vault 中,仅在按需时通过代理获取并解密,提升了安全性。 2. 该服务内置了针对 Claude 模型优化的智能体循环,包括上下文重置机制,解决了早期模型(如 Sonnet 4.5)的“上下文焦虑”问题。 3. 智能体、环境和会话三个核心资源允许开发者一次配置,多次运行,并支持长时间任务的暂停、恢复和完整追溯。
核心观点提炼高信息密度,值得细读
正文内容概括Google 本周密集发布多款 AI 产品。Gemma 4 12B 作为统一的 encoder-free 多模态模型,支持笔记本端完全离线运行,并通过 Quantization-Aware Training (QAT) 降低内存占用;Nano Banana 2 与 Nano Banana Pro 企业智能体平台正式商用;Co-Scientist 科研多智能体系统可生成并优化科学假设;Magenta RealTime 2 开放权重实时音乐模型支持 MIDI 与手势交互。对开发者而言,端侧部署与企业智能体工具链得到显著增强。 核心观点: 1. Gemma 4 12B 采用 encoder-free 架构,支持笔记本完全离线运行多模态任务。 2. Gemma 4 及其 drafters 经 Quantization-Aware Training (QAT) 优化,可降低内存需求并最大化端侧性能。 3. Magenta RealTime 2 为开放权重实时音乐模型,支持通过 MIDI 键盘、文本提示和手势进行演奏交互。
核心观点提炼重磅首发或硬核洞察
正文内容概括美国出口管制解除后,Anthropic 于 6 月 30 日宣布重新上线 Claude Fable 5 模型。此前因 Amazon 研究人员发现越狱方法,政府于 6 月 12 日实施管制。Anthropic 训练了新的安全分类器,在 99% 以上情况下阻止该越狱技术,并联合 Amazon、Microsoft、Google 等制定行业越狱评估框架。Fable 5 将于 7 月 1 日面向全球用户开放。 核心观点: 1. 新安全分类器在 99% 以上情况下阻止 Amazon 报告中的越狱技术。 2. Fable 5 的越狱行为仅涉及常规防御性网络安全工作,未暴露 Mythos 级别的独特网络能力。 3. Anthropic 联合 Amazon、Microsoft、Google 等开发行业统一的越狱严重性评估框架。
核心观点提炼高信息密度,值得细读
正文内容概括MiniMax 联合 Cysic 举办 CyOps Arena 黑客松,为 M3 提供 5000 美元奖金池及限时 80% token 折扣,降低开发者参与门槛。
核心观点提炼常规快讯,保留列表
正文内容概括开源电子书《Claude Code From Scratch》通过约4300行代码(TypeScript和Python两个版本)复现了Claude Code的核心架构,包括Agent Loop、13个工具(支持并行执行和流式早期启动)、4层上下文压缩、语义记忆召回、技能系统、多Agent和MCP集成。全书13章,每章为分步教程,对照真实源码讲解简化实现,帮助开发者理解coding agent的工作原理。 核心观点: 1. 用约4300行代码复现Claude Code核心架构,包括Agent Loop、13个工具、4层上下文压缩等。 2. 提供TypeScript和Python两个版本,每章对照真实源码讲解简化实现。
核心观点提炼高信息密度,值得细读
正文内容概括Anthropic 发布 Claude Sonnet 5,定位为 Agent 能力接近旗舰 Opus 4.8 但价格仅为其 40% 的模型。在 Agent 编程基准上 Sonnet 5 得分 63.2%,高于前代 Sonnet 4.6 的 58.1%,低于 Opus 4.8 的 69.2%;知识工作基准甚至略超 Opus 4.8。模型更换了新分词器,同样文本可能消耗 1.0-1.35 倍 Token,但推广期定价已对冲此涨幅。对开发者而言,Sonnet 5 提供了更优的性价比,但需注意推广期结束后实际花费涨幅可能高于标价涨幅。 核心观点: 1. Sonnet 5 在 Agent 编程基准得分 63.2%,Sonnet 4.6 为 58.1%,Opus 4.8 为 69.2%。 2. 新分词器导致同样文本消耗 1.0-1.35 倍 Token,推广期定价已对冲此涨幅。 3. API 推广价(至 8 月 31 日)为输入 $2/百万 Token、输出 $10/百万 Token,之后涨至 $3 和 $15。
核心观点提炼高信息密度,值得细读
正文内容概括Google DeepMind 联合多家机构发起 1000 万美元研究基金,探索大规模 AI 智能体交互中的集体行为涌现。
核心观点提炼常规快讯,保留列表
正文内容概括MiniMax 宣布开源高性能 MSA kernel 库,并预告 M3 模型权重将于本周五发布。MSA 库为稀疏注意力提供底层高性能实现,开发者可通过 GitHub 获取代码与论文。此举降低了稀疏注意力优化门槛,同时 M3 开放权重将让研究者能够本地部署该模型进行后续研究与开发。
核心观点提炼高信息密度,值得细读
正文内容概括MiniMax 发布开放权重模型 MiniMax M3。该模型总参数量约 428B、激活参数量约 23B,支持 1M-token 上下文窗口与原生多模态理解,并具备前沿编码与 Agent 能力。模型权重已上架 Hugging Face,同时发布了 MiniMax Sparse Attention 论文。开发者可直接下载部署,在超长上下文、多模态及 Agent 场景中进行应用开发与评测。 核心观点: 1. MiniMax M3 总参数量约 428B,激活参数量约 23B,以开放权重形式发布。 2. 模型支持 1M-token 上下文窗口,具备原生多模态理解及前沿编码与 Agent 能力。 3. 权重已上架 Hugging Face,并配套发布 MiniMax Sparse Attention 技术论文。
核心观点提炼高信息密度,值得细读
正文内容概括Anthropic 为 Claude Managed Agents 新增定时运行和环境变量安全存储功能,均在公开测试版上线。定时运行通过 cron 调度自动执行重复任务,如夜间数据同步、合规扫描,无需额外构建调度器。环境变量存储在 vaults 中,支持 CLI 工具安全认证,密钥仅在网络边界按域授权使用,Agent 无法直接访问。这些功能简化了自动化工作流和工具集成,对开发者意味着更少的调度基础设施和更安全的密钥管理。 核心观点: 1. 定时运行通过 cron 调度自动启动新会话完成任务,无需开发者构建或托管调度器。 2. 环境变量存储在 vaults 中,密钥仅在网络边界按域授权使用,Agent 无法直接访问。 3. Browserbase 和 KERNEL 的 CLI 通过 vaults 认证,首次为 Managed Agents 提供浏览器能力。
核心观点提炼高信息密度,值得细读
正文内容概括Anthropic 发布 Claude Sonnet 5,定位为迄今最具智能体能力的 Sonnet 模型,在推理、工具使用和编码方面显著提升,性能接近 Opus 4.8 但价格更低。该模型已全面上线,成为 Free 和 Pro 计划的默认模型,并可通过 Claude API 使用。开发者可调整 effort 级别以平衡成本与性能,对构建复杂多步任务的智能体应用具有重要价值。 核心观点: 1. Sonnet 5 在 BrowseComp 和 OSWorld-Verified 等智能体评测中,通过调整 effort 级别可在部分任务上匹配 Opus 4.8 的性能。 2. Sonnet 5 引入新 tokenizer,输入 token 数约为之前的 1.0–1.35 倍,但通过定价调整实现大致成本中性。 3. Sonnet 5 的网络安全任务能力远低于当前 Opus 模型,整体不良行为率低于 Sonnet 4.6。
核心观点提炼重磅首发或硬核洞察
本节暂无内容。
正文内容概括智谱AI发布GLM-5.2模型,在移动应用开发能力上实现大幅提升。内部基准测试包含35个挑战性移动开发任务,每个任务运行两次共70次试验,以核心功能无重大问题为完成标准。GLM-5.2完成率从GLM-5.1的21/70提升至48/70,提升超过两倍,但仍低于Claude Fable 5的56/70。对开发者而言,该模型在长周期任务上的进步值得关注。 核心观点: 1. GLM-5.2在内部移动开发基准测试中完成率从21/70提升至48/70,提升超过两倍。 2. 基准测试包含35个挑战性移动开发任务,每个任务运行两次共70次试验。 3. Claude Fable 5在该基准上完成率为56/70,高于GLM-5.2。
核心观点提炼高信息密度,值得细读
正文内容概括Anthropic 发布 Claude Tag 的 Slack 集成功能,让团队在频道中 @ Claude 执行任务,Karpathy 称其为 LLM 交互的第三次重大重新设计。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 发布了 GPT-5.6 系列模型的有限预览,包括旗舰模型 Sol、均衡模型 Terra 和高效模型 Luna。Sol 作为下一代前沿模型,Terra 面向日常高效工作,Luna 则针对高容量任务提供快速且经济的方案。此次发布为开发者提供了不同性能与成本梯度的选择,有助于在具体应用中灵活部署。 核心观点: 1. GPT-5.6 系列包含三个模型:旗舰 Sol、均衡 Terra 和高效 Luna,分别面向前沿、日常和高容量场景。 2. Luna 被定位为快速且经济的模型,适合高吞吐量任务。
核心观点提炼重磅首发或硬核洞察
正文内容概括OpenAI 于6月26日发布 GPT-5.6 系列模型,包含旗舰级 Sol、日常级 Terra 和经济级 Luna。因美国政府要求,目前仅向约20家经审批的合作伙伴开放预览。Sol 新增 max 深度推理与 ultra 多子 Agent 并行模式,在 Terminal-Bench 2.1 上 Sol Ultra 得分 91.9%。Terra 性能接近上一代 GPT-5.5 但价格减半,Luna 主打低成本高吞吐。7月将上线 Cerebras 硬件加速版本,推理速度达每秒750 token。对开发者而言,Terra 的高性价比和 Sol 的 ultra 模式值得关注。 核心观点: 1. Sol Ultra 在 Terminal-Bench 2.1 上得分 91.9%,高于 Claude Mythos 5 的 88% 和 Gemini 3.1 Pro Preview 的 70.7%。 2. Sol 在 ExploitBench 上用约三分之一的 token 达到 Mythos Preview 的网络安全水平。 3. Sol 的 ultra 模式可调用多个子 Agent 并行处理复杂任务,无需开发者自行搭建 Agent 编排框架。
核心观点提炼高信息密度,值得细读
正文内容概括OpenAI 为高级 Codex 用户推出了可复用、可继承的权限配置文件,替代了粗粒度的沙箱模式。该配置绑定操作系统强制规则(如文件读/写/拒绝,甚至支持 **/*.env 模式),并针对每个域和 Unix 套接字进行网络权限控制。此外,还提供了故障关闭的管理员允许列表,实现了每个任务的最小权限控制。这对开发者意味着更精细、更安全的代码执行环境。 核心观点: 1. 权限配置文件支持继承,可复用且绑定 OS 强制规则,实现比粗粒度沙箱更细粒度的控制。 2. 支持 **/*.env 等文件模式,以及按域和 Unix 套接字的网络权限控制。 3. 提供故障关闭的管理员允许列表,确保最小权限原则。
核心观点提炼高信息密度,值得细读
正文内容概括智谱AI在ModelScope发布GLM-5.2模型,支持100万上下文窗口,并显著提升编码能力。该模型在Code Arena全球可用模型中排名第二,在FrontierSWE、SWE-Marathon和PostTrainBench等基准上成为排名最高的开源模型,性能介于Claude Opus 4.7和4.8之间。GLM-5.2采用KV8、LayerSplit、IndexShare等技术实现百万上下文,在Terminal-Bench 2.1上达到开源SOTA,较GLM-5.1提升17.5%。开发者可使用vLLM、SGLang、Transformers进行推理部署。 核心观点: 1. GLM-5.2在Code Arena全球所有可用模型中排名第二。 2. 在Terminal-Bench 2.1上达到开源SOTA,较GLM-5.1提升17.5%。 3. 采用KV8、LayerSplit、IndexShare技术实现100万上下文窗口。
核心观点提炼高信息密度,值得细读
摘要由 LLM 生成,请以原文为准。