OpenAI 预览了下一代模型 GPT-5.6 Sol,在编程、科学和网络安全方面能力更强,并配备了最先进的安全栈
正文内容概括OpenAI 预览了下一代模型 GPT-5.6 Sol,该模型在编程、科学和网络安全方面能力更强,并配备了最先进的安全栈。这对开发者意味着需要关注其增强的编码能力及安全特性,以便在应用中集成和利用。
核心观点提炼重磅首发或硬核洞察
这期 AIWatch 月度回顾围绕「product、Agent、基准测试」整理本月最值得复盘的模型、产品、工程与行业变化。聚焦 30 · 关注 5 · 跟进 0。
如果只想快速复盘本月变化,先读:智谱AI在ModelScope发布GLM-5.2模型,支持100万上下文、更强编码能力,在多项基准上达到开源SOTA → 智谱AI发布GLM-5.2,在移动应用开发能力上实现大幅提升,内部基准测试完成率从21/70提升至48/70 → OpenAI 发布 Daybreak 安全工具集,包括 Codex Security 和 GPT-5.5-Cyber,用于规模化漏洞发现与修复。
本月回看「product、Agent、基准测试」,更重要的是判断哪些变化会沉淀为长期基础设施。
正文内容概括OpenAI 预览了下一代模型 GPT-5.6 Sol,该模型在编程、科学和网络安全方面能力更强,并配备了最先进的安全栈。这对开发者意味着需要关注其增强的编码能力及安全特性,以便在应用中集成和利用。
核心观点提炼重磅首发或硬核洞察
正文内容概括OpenAI 发布了 Daybreak 安全工具集,包含 Codex Security 和 GPT-5.5-Cyber 两个组件,旨在帮助组织规模化地发现、验证和修复漏洞。这对开发者意味着可以利用 AI 驱动的安全工具提升漏洞管理效率,降低安全风险。 核心观点: 1. Daybreak 工具集包含 Codex Security 和 GPT-5.5-Cyber 两个具体组件。 2. 该工具集覆盖漏洞发现、验证和修复的完整流程。
核心观点提炼高信息密度,值得细读
正文内容概括Anthropic 发布 Mythos-class 模型 Claude Fable 5 与 Claude Mythos 5,在软件工程、视觉与科研基准达到 SOTA。Fable 5 面向一般用户,新增网络安全、生物化学与蒸馏分类器,触发时回退至 Claude Opus 4.8;Mythos 5 通过 Project Glasswing 向网络防御者等受信用户开放。开发者可通过 API 调用 claude-fable-5,但需留意保守的安全策略可能导致部分无害请求被拦截,且 Mythos-class 流量实行 30 天数据保留。 核心观点: 1. Fable 5 在 Stripe 的 5000 万行 Ruby 代码库中一日完成原本需团队两月以上的迁移,且在 Cognition FrontierCode 评估中以中等 effort 取得 frontier models 最高分。 2. Fable 5 对网络安全、生物化学及蒸馏查询启用新安全分类器,触发时自动回退至 Claude Opus 4.8,平均触发率低于 5%。 3. Mythos 5 在内部药物设计中将部分流程加速约 10 倍,14 个蛋白靶点中 9 个获得强候选;其分子生物学假设在盲测中被科学家偏好约 80%。
核心观点提炼重磅首发或硬核洞察
正文内容概括xAI 在 Grok Build 中推出 /goal 功能,支持用户设定一个长期目标后,由系统自动生成并执行多轮子代理,自主完成实现与验证。该功能旨在提升 Grok 在复杂、多步骤任务上的自动化执行能力,对开发者而言,意味着可以更高效地委托长期任务给 AI 智能体,减少人工干预。 核心观点: 1. /goal 功能通过多轮子代理实现自主执行与验证,而非单次指令。
核心观点提炼高信息密度,值得细读
正文内容概括智谱AI发布GLM-5.2模型,在移动应用开发能力上实现大幅提升。内部基准测试包含35个挑战性移动开发任务,每个任务运行两次共70次试验,以核心功能无重大问题为完成标准。GLM-5.2完成率从GLM-5.1的21/70提升至48/70,提升超过两倍,但仍低于Claude Fable 5的56/70。对开发者而言,该模型在长周期任务上的进步值得关注。 核心观点: 1. GLM-5.2在内部移动开发基准测试中完成率从21/70提升至48/70,提升超过两倍。 2. 基准测试包含35个挑战性移动开发任务,每个任务运行两次共70次试验。 3. Claude Fable 5在该基准上完成率为56/70,高于GLM-5.2。
核心观点提炼高信息密度,值得细读
正文内容概括Anthropic 发布 Claude Tag,将 Claude 作为团队成员集成到 Slack 中。用户可通过 @Claude 在频道中异步委派任务,Claude 能积累上下文、主动提醒并跨频道学习。该功能基于 Opus 4.8,面向 Claude Enterprise 和 Team 客户开放 beta 版。Anthropic 内部产品团队 65% 的代码已由内部版 Claude Tag 生成,标志着从单次对话向团队协作智能体的演进。 核心观点: 1. Claude Tag 在 Slack 频道内实现多用户共享同一 Claude 实例,支持多人接力协作而非单次对话。 2. Claude 可跨频道自动学习上下文(不读取私密频道),并具备主动提醒和异步任务调度能力。 3. Anthropic 内部产品团队 65% 的代码由内部版 Claude Tag 生成,使用模式已扩展至指标追踪、工单处理等非工程场景。
核心观点提炼高信息密度,值得细读
正文内容概括Anthropic 发布 Claude Tag 的 Slack 集成功能,让团队在频道中 @ Claude 执行任务,Karpathy 称其为 LLM 交互的第三次重大重新设计。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 发布了 GPT-5.6 系列模型的有限预览,包括旗舰模型 Sol、均衡模型 Terra 和高效模型 Luna。Sol 作为下一代前沿模型,Terra 面向日常高效工作,Luna 则针对高容量任务提供快速且经济的方案。此次发布为开发者提供了不同性能与成本梯度的选择,有助于在具体应用中灵活部署。 核心观点: 1. GPT-5.6 系列包含三个模型:旗舰 Sol、均衡 Terra 和高效 Luna,分别面向前沿、日常和高容量场景。 2. Luna 被定位为快速且经济的模型,适合高吞吐量任务。
核心观点提炼重磅首发或硬核洞察
正文内容概括LangChain 发布了 Deep Agents v0.6,新增代码解释器功能。该功能允许智能体在运行时内部调用工具,将中间结果保留在模型上下文之外,仅将相关输出传回,从而减少往返次数和 token 浪费。这对开发者意味着可以构建更高效、成本更低的智能体应用。 核心观点: 1. Deep Agents v0.6 新增代码解释器,允许 Agent 在运行时内部调用工具。 2. 该功能通过将中间结果保留在模型上下文之外,仅传回相关输出来减少 token 浪费。
核心观点提炼高信息密度,值得细读
正文内容概括OpenAI 于6月26日发布 GPT-5.6 系列模型,包含旗舰级 Sol、日常级 Terra 和经济级 Luna。因美国政府要求,目前仅向约20家经审批的合作伙伴开放预览。Sol 新增 max 深度推理与 ultra 多子 Agent 并行模式,在 Terminal-Bench 2.1 上 Sol Ultra 得分 91.9%。Terra 性能接近上一代 GPT-5.5 但价格减半,Luna 主打低成本高吞吐。7月将上线 Cerebras 硬件加速版本,推理速度达每秒750 token。对开发者而言,Terra 的高性价比和 Sol 的 ultra 模式值得关注。 核心观点: 1. Sol Ultra 在 Terminal-Bench 2.1 上得分 91.9%,高于 Claude Mythos 5 的 88% 和 Gemini 3.1 Pro Preview 的 70.7%。 2. Sol 在 ExploitBench 上用约三分之一的 token 达到 Mythos Preview 的网络安全水平。 3. Sol 的 ultra 模式可调用多个子 Agent 并行处理复杂任务,无需开发者自行搭建 Agent 编排框架。
核心观点提炼高信息密度,值得细读
正文内容概括OpenAI 与 Broadcom 联合推出定制 AI 芯片 Jalapeño,专为大语言模型推理优化,旨在提升 AI 系统的性能、效率与规模。该芯片针对 LLM 推理场景设计,有望降低推理成本并加速模型部署。对开发者而言,未来可能获得更高效、更低成本的推理服务,从而支持更大规模的应用。
核心观点提炼高信息密度,值得细读
正文内容概括OpenAI 为高级 Codex 用户推出了可复用、可继承的权限配置文件,替代了粗粒度的沙箱模式。该配置绑定操作系统强制规则(如文件读/写/拒绝,甚至支持 **/*.env 模式),并针对每个域和 Unix 套接字进行网络权限控制。此外,还提供了故障关闭的管理员允许列表,实现了每个任务的最小权限控制。这对开发者意味着更精细、更安全的代码执行环境。 核心观点: 1. 权限配置文件支持继承,可复用且绑定 OS 强制规则,实现比粗粒度沙箱更细粒度的控制。 2. 支持 **/*.env 等文件模式,以及按域和 Unix 套接字的网络权限控制。 3. 提供故障关闭的管理员允许列表,确保最小权限原则。
核心观点提炼高信息密度,值得细读
正文内容概括剑桥大学与英伟达等机构提出红皇后哥德尔机,让AI智能体与评估者共同进化,避免固定基准导致的性能停滞。传统自改进智能体训练依赖固定基准或评估器,导致分数停滞或易被利用。该方法允许评估者在安全交接点同步改进,每个训练阶段使用冻结评估器测试智能体,同时用保留的人类或客观答案测试潜在更优评估器。在编程、论文写作与评审、证明写作与评分等任务上验证,编程任务中比此前最佳自改进智能体节省1.35至1.72倍token,论文写作中联合进化写手被评审小组接受率比固定评估基线高约1.86倍。该工作表明更强AI系统需要更强评估者共同成长。 核心观点: 1. 红皇后哥德尔机在编程任务中比此前最佳自改进智能体节省1.35至1.72倍token,因廉价代码审查者提供有用反馈。 2. 论文写作任务中,联合进化写手被评审小组接受率比固定评估基线高约1.86倍。
核心观点提炼高信息密度,值得细读
正文内容概括Cloudflare Workflows 新增 saga 风格回滚功能,允许开发者为多步骤应用中的每一步指定补偿操作。这一更新使开发者能够更可靠地处理部分失败场景,提升工作流的容错性和可恢复性。对构建复杂、长时间运行应用的开发者而言,该功能简化了错误处理逻辑,降低了手动编写补偿代码的复杂度。 核心观点: 1. Cloudflare Workflows 新增 saga 风格回滚,允许为每个 do() 步骤指定补偿操作。
核心观点提炼高信息密度,值得细读
正文内容概括DeepReinforce 发布了 MIT 许可的开源编程智能体模型家族 Ornith-1.0,基于预训练的 Gemma 4 和 Qwen 3.5 构建。旗舰模型 Ornith-1.0-397B MoE(17B 活跃参数)在 SWE-Bench Verified 和 Terminal-Bench 2.1 上分别取得 82.4 和 77.5 的成绩,超越 Claude Opus 4.7。该系列采用新颖的自我改进训练策略,在强化学习中同时优化答案和任务脚手架(包括计划、记忆模式、工具节奏、错误处理和搜索过程)。9B 模型在 SWE-Bench Verified 上达到 69.4,表现突出。对开发者而言,这意味着获得了可自由使用、性能领先的开源编程智能体模型。 核心观点: 1. Ornith-1.0 采用自我改进训练策略,在 RL 中先让模型提出更好的任务脚手架,再用其生成解决方案,奖励同时更新两个阶段。 2. 旗舰 397B MoE 模型(17B 活跃参数)在 SWE-Bench Verified 上达 82.4,在 Terminal-Bench 2.1 上达 77.5,均超越 Claude Opus 4.7。 3. 9B 模型在 SWE-Bench Verified 上达到 69.4,展示了小参数模型的竞争力。
核心观点提炼高信息密度,值得细读
正文内容概括OpenRouter 发布教程,指导开发者构建能应对模型移除和废弃的鲁棒 AI Agent,并提及 EU AI Act 等法规要求。
核心观点提炼常规快讯,保留列表
正文内容概括DeepInfra 上线了智谱 AI 的 GLM-5.2 模型。该模型采用 744B/40B MoE 架构,MIT 许可,支持 1M 上下文窗口。在 FrontierSWE、PostTrainBench 和 SWE-Marathon 基准测试中,GLM-5.2 表现领先于其他开源模型。DeepInfra 提供该模型的 API 服务,定价为每百万 token 输入 $1.40、输出 $4.40、缓存 $0.25。开发者可通过 DeepInfra 平台直接调用该模型。 核心观点: 1. GLM-5.2 采用 744B/40B MoE 架构,支持 1M 上下文窗口,MIT 许可。 2. 在 FrontierSWE、PostTrainBench、SWE-Marathon 三项基准中,GLM-5.2 为表现最佳的开源模型。 3. DeepInfra 定价:输入 $1.40/1M tokens,输出 $4.40/1M tokens,缓存 $0.25/1M tokens。
核心观点提炼高信息密度,值得细读
正文内容概括DeepSeek 开源了 DSpark 投机解码框架,该框架为 DeepSeek-V4 模型附加草稿模块,通过并行草稿骨干与轻量马尔可夫头减少后缀衰减,并采用置信度调度验证根据实时 GPU 负载调整检查令牌数。离线测试中,接受长度相比 DFlash 和 Eagle3 提升 16-31%;生产环境中,单用户生成速度相比 MTP-1 基线提升 57-85%,且无损。训练代码库 DeepSpec 以 MIT 许可证发布。 核心观点: 1. DSpark 采用并行草稿骨干与马尔可夫头组合,有效减少后缀衰减。 2. 置信度调度验证机制根据实时 GPU 负载动态调整待检查令牌数。 3. 生产环境单用户生成速度相比 MTP-1 基线提升 57-85%,且无损。
核心观点提炼高信息密度,值得细读
正文内容概括智谱AI发布GLM-5.2模型,在ARC-AGI-2基准测试中取得22.8%准确率,每任务成本0.25美元。相比2025年5月最佳模型(3.0%)提升7.6倍,成本仅为GPT-5.5($1.87/任务)的七分之一。在ARC-AGI-1上达到77.0%准确率,性能与GPT-5.4及GPT-5.5(低推理努力)相当。 核心观点: 1. GLM-5.2在ARC-AGI-2上22.8%准确率,较2025年5月最佳模型3.0%提升7.6倍。 2. GLM-5.2每任务成本$0.25,仅为GPT-5.5($1.87)的约七分之一。 3. GLM-5.2在ARC-AGI-1上77.0%准确率,性能与GPT-5.4及GPT-5.5(低推理努力)相当。
核心观点提炼高信息密度,值得细读
正文内容概括LangChain 发布了动态子代理功能,允许主代理在代码解释器中通过编程方式动态创建和编排子代理。该功能旨在处理传统工具调用难以可靠完成的大规模任务,例如处理数百份文档或分析数千个数据点。对开发者而言,这提供了一种更灵活、可扩展的代理架构,用于构建复杂工作流。 核心观点: 1. 动态子代理通过代码解释器实现编程式编排,而非静态定义。 2. 该功能专门用于处理工具调用不可靠的大规模文档或数据分析任务。
核心观点提炼高信息密度,值得细读
正文内容概括Catnip 发布 22B 参数实时音视频基础模型 MaineCoon,可将文本提示转化为带同步语音、动作和表情的实时角色流。该模型是首个流式原生模型,首帧亚秒级,单 H100 达 47.5FPS,单 RTX Pro 6000 达 30FPS,内部测试吞吐量比同类音视频系统快约 7 倍。对开发者而言,这为构建实时社交界面等交互式 AI 应用提供了新的基础模型选择。 核心观点: 1. MaineCoon 是 22B 参数的实时音视频基础模型,支持文本到同步语音、动作和表情的角色流生成。 2. 首帧亚秒级,单 H100 达 47.5FPS,单 RTX Pro 6000 达 30FPS,吞吐量比同类系统快约 7 倍。
核心观点提炼高信息密度,值得细读
正文内容概括Google 本周密集发布多款 AI 产品。Gemma 4 12B 作为统一的 encoder-free 多模态模型,支持笔记本端完全离线运行,并通过 Quantization-Aware Training (QAT) 降低内存占用;Nano Banana 2 与 Nano Banana Pro 企业智能体平台正式商用;Co-Scientist 科研多智能体系统可生成并优化科学假设;Magenta RealTime 2 开放权重实时音乐模型支持 MIDI 与手势交互。对开发者而言,端侧部署与企业智能体工具链得到显著增强。 核心观点: 1. Gemma 4 12B 采用 encoder-free 架构,支持笔记本完全离线运行多模态任务。 2. Gemma 4 及其 drafters 经 Quantization-Aware Training (QAT) 优化,可降低内存需求并最大化端侧性能。 3. Magenta RealTime 2 为开放权重实时音乐模型,支持通过 MIDI 键盘、文本提示和手势进行演奏交互。
核心观点提炼重磅首发或硬核洞察
正文内容概括开源电子书《Claude Code From Scratch》通过约4300行代码(TypeScript和Python两个版本)复现了Claude Code的核心架构,包括Agent Loop、13个工具(支持并行执行和流式早期启动)、4层上下文压缩、语义记忆召回、技能系统、多Agent和MCP集成。全书13章,每章为分步教程,对照真实源码讲解简化实现,帮助开发者理解coding agent的工作原理。 核心观点: 1. 用约4300行代码复现Claude Code核心架构,包括Agent Loop、13个工具、4层上下文压缩等。 2. 提供TypeScript和Python两个版本,每章对照真实源码讲解简化实现。
核心观点提炼高信息密度,值得细读
正文内容概括MiniMax 宣布开源高性能 MSA kernel 库,并预告 M3 模型权重将于本周五发布。MSA 库为稀疏注意力提供底层高性能实现,开发者可通过 GitHub 获取代码与论文。此举降低了稀疏注意力优化门槛,同时 M3 开放权重将让研究者能够本地部署该模型进行后续研究与开发。
核心观点提炼高信息密度,值得细读
正文内容概括MiniMax 发布开放权重模型 MiniMax M3。该模型总参数量约 428B、激活参数量约 23B,支持 1M-token 上下文窗口与原生多模态理解,并具备前沿编码与 Agent 能力。模型权重已上架 Hugging Face,同时发布了 MiniMax Sparse Attention 论文。开发者可直接下载部署,在超长上下文、多模态及 Agent 场景中进行应用开发与评测。 核心观点: 1. MiniMax M3 总参数量约 428B,激活参数量约 23B,以开放权重形式发布。 2. 模型支持 1M-token 上下文窗口,具备原生多模态理解及前沿编码与 Agent 能力。 3. 权重已上架 Hugging Face,并配套发布 MiniMax Sparse Attention 技术论文。
核心观点提炼高信息密度,值得细读
正文内容概括智谱AI在ModelScope发布GLM-5.2模型,支持100万上下文窗口,并显著提升编码能力。该模型在Code Arena全球可用模型中排名第二,在FrontierSWE、SWE-Marathon和PostTrainBench等基准上成为排名最高的开源模型,性能介于Claude Opus 4.7和4.8之间。GLM-5.2采用KV8、LayerSplit、IndexShare等技术实现百万上下文,在Terminal-Bench 2.1上达到开源SOTA,较GLM-5.1提升17.5%。开发者可使用vLLM、SGLang、Transformers进行推理部署。 核心观点: 1. GLM-5.2在Code Arena全球所有可用模型中排名第二。 2. 在Terminal-Bench 2.1上达到开源SOTA,较GLM-5.1提升17.5%。 3. 采用KV8、LayerSplit、IndexShare技术实现100万上下文窗口。
核心观点提炼高信息密度,值得细读
正文内容概括SGLang 发布 v0.5.14 版本,新增对 GLM-5.2、Kimi-K2.7-Code、LiquidAI LFM2.5 等 7 个模型的支持。核心改进包括:引入 LPLB 负载均衡器以优化 MoE 专家流量;Kimi-Linear (KDA) 在 NVIDIA Blackwell 上通过新 CuteDSL prefill 内核加速;降低线性注意力模型内存占用;通过 MSCCL++ 和 MNNVL 融合加速多 GPU 通信。对开发者而言,该版本提升了推理性能和硬件兼容性,尤其适合大规模 MoE 和线性注意力模型的部署优化。 核心观点: 1. LPLB 负载均衡器通过 DeepEP 均衡 MoE 专家跨 GPU 流量,提升分布式推理效率。 2. Kimi-Linear (KDA) 在 NVIDIA Blackwell 上使用 CuteDSL prefill 内核实现加速。 3. DeepSeek-V4 获得多项性能更新,包括 NVFP4 MoE、FlashMLA head64 decode 和更快 FP8 量化。
核心观点提炼高信息密度,值得细读
正文内容概括MiniMax 发布 MaxProof 框架,将 Generative-Verifier RL 与 Evolutionary Search 相结合以提升 Test-time Scaling 能力,使其 M3 模型在数学证明任务上超越 human gold-medal threshold。该工作涵盖基座模型优化、验证器对齐、细化能力构建及测试时扩展框架设计,形成完整的数学证明技术路径,为复杂推理与形式化验证的规模化扩展提供了可复现的范式。 核心观点: 1. MaxProof 框架采用 Generative-Verifier RL 与 Evolutionary Search 实现 Test-time Scaling。 2. M3 在数学证明任务上超越 human gold-medal threshold。 3. 技术路径涵盖基座模型优化、验证器对齐、细化能力构建与测试时扩展框架设计四个环节。
核心观点提炼高信息密度,值得细读
正文内容概括Artificial Analysis 发布 AA-Briefcase 基准测试,用于评估模型在长期、多步骤知识工作项目中的能力。测试场景由行业专家设计,包含数千输入文件(如 Slack 消息、邮件)。Claude Fable 5 以 1587 Elo 领先,但每任务成本约 $31;开源模型 GLM-5.2 以约 $2.40 成本取得 1266 Elo,性价比突出。所有模型在真实复杂任务中表现仍有限,顶级模型仅 3% 任务满足全部标准。 核心观点: 1. Claude Fable 5 在 AA-Briefcase 上以 1587 Elo 领先,未使用 Opus 4.8 回退。 2. GLM-5.2 (max) 以 $2.40 成本取得 1266 Elo,性价比优于 Claude Opus 4.8。 3. 所有模型在 91 个任务中仅 3% 满足全部 rubric 标准,31 个任务无模型得分超 50%。
核心观点提炼高信息密度,值得细读
正文内容概括Unsloth AI 将 GLM-5.2 开放权重模型从 1.51TB 压缩至 238GB(-84% 大小),采用 2-bit 量化,保留约 82% 准确率。该模型可在 256GB Mac 或同等 RAM/VRAM 配置上本地运行。GLM-5.2 本身具备 1M 上下文窗口,在编码和智能体任务上有显著提升。对开发者而言,这意味着可以在消费级硬件上部署前沿开放权重模型,但需接受精度损失。 核心观点: 1. Unsloth 将 GLM-5.2 从 1.51TB 压缩至 238GB,大小减少 84%。 2. 2-bit 量化版本保留约 82% 的原始准确率。 3. 模型可在 256GB Mac 或同等 RAM/VRAM 配置上本地运行。
核心观点提炼高信息密度,值得细读
正文内容概括微软AI发布MAI-Image-2.5图像生成与编辑模型,具备强照片级真实感、精确编辑和细节处理能力。该模型宣传图由自身生成,用户可通过Playground或OpenRouter体验。
核心观点提炼微软发布新一代图像生成与编辑模型,具备高真实感和精细编辑能力,并提供公开试用渠道,对AI图像创作领域具有重要参考价值。
正文内容概括Anthropic 与 IT 服务商 DXC 达成多年全球联盟。DXC 将培训数万名 Claude 认证工程师,把 Claude 引入银行、航空、保险等受监管行业的关键业务系统。此前 DXC 已用 Claude 生成其 AI 原生运维平台 OASIS 超 95% 的代码,开发效率提升 10 倍。对开发者而言,这标志着 Claude 正通过大型服务商深度嵌入企业核心系统,并验证了其在代码生成与智能体工作流上的规模化落地能力。 核心观点: 1. DXC 称其 AI 原生平台 OASIS 超 95% 代码由 Claude 生成,开发速度提升 10 倍,已服务逾 50 家客户。 2. OASIS 以 Claude 为默认基础模型驱动智能体工作流,DXC 将培训数万名 Claude 认证工程师嵌入客户组织。 3. 联盟首批落地保险现代化、遗留代码重构(MaaS)、基于 Claude Security 的 SOC 安全子智能体及嵌入式应用维护智能体。
核心观点提炼高信息密度,值得细读
本节暂无内容。
摘要由 LLM 生成,请以原文为准。