这期 AIWatch 精选周刊围绕「product、Agent、discussion」复盘过去一周的关键变化,先给出编辑导读,再把核心精选和延伸内容串成一条可阅读的脉络。聚焦 30 · 关注 0 · 跟进 10。
如果只想抓住本周主线,先读:OpenAI 演示了通过文本指令生成3D场景的能力,无需编写代码或上传资产,展示了AI的自主创作潜力 → Claude 开发者官方分享:团队内部高频使用这两种经典多智能体模式「Advisor」和「Orchestrator」来发挥 Fable 5 最高价值、同时把成本降到最低! # 模式一:Advi... → OpenAI 发布了新一代语音模型 GPT-Live,用于增强 ChatGPT 语音交互的自然度。
本周最值得带走的观察,是「product、Agent、discussion」已经从单点更新变成连续趋势。
正文内容概括OpenAI 演示了通过文本指令生成3D场景的能力,无需编写代码或上传资产,展示了AI的自主创作潜力。
核心观点提炼常规快讯,保留列表
正文内容概括Claude 开发者团队分享了两种多智能体模式:Advisor(顾问)模式和 Orchestrator(编排者)模式,通过组合 Sonnet 5 和 Fable 5 实现接近顶级模型性能并大幅降低成本。Advisor 模式中 Sonnet 5 作为执行者,低频率调用 Fable 5 获取建议,在 SWE-bench Pro 上达到 Fable 5 约 92% 的性能,成本仅约 63%。Orchestrator 模式中 Fable 5 作为编排者规划并委派任务给多个 Sonnet 5 worker,在 BrowseComp 上达到 Fable 5 约 96% 的性能,成本仅约 46%。开发者可根据任务类型选择模式以优化性价比。 核心观点: 1. Advisor 模式在 SWE-bench Pro 上以 $1.40 成本实现 ~84% 准确率,相比纯 Fable 5 的 $2.25 成本节省约 37%。 2. Orchestrator 模式在 BrowseComp 上以 $18.53 成本实现 86.8% 准确率,相比纯 Fable 5 的 $40.56 成本节省约 54%。 3. Orchestrator 模式相比纯 Sonnet 5 准确率提升约 9 个百分点,成本仅增加约 $2.5。
核心观点提炼高信息密度,值得细读
正文内容概括OpenAI 发布了新一代语音模型 GPT-Live,旨在提升 ChatGPT 语音交互的自然度。该模型现已用于 ChatGPT Voice 功能,为开发者提供了更流畅、更接近真人对话的语音交互能力。
核心观点提炼高信息密度,值得细读
正文内容概括MiniMax 对 H3 开源社区的基准测试和机器人数据集表示期待,Ostris 已生成 1K 视频数据集测试模型能力。
核心观点提炼常规快讯,保留列表
正文内容概括Qwen 发布了 Qwen-MM-Plugins,使智能体能够原生处理图像、视频、文档等多模态内容,并支持视频编辑和3D/CAD操作。
核心观点提炼常规快讯,保留列表
正文内容概括AI Agent规模化部署带来成本挑战。Databricks团队基于实践提出四大成本杠杆:持续迁移到效率更高的开源/低成本模型、动态请求路由(成本降30%+质量持平)、渐进式摩擦替代硬预算、削减Token开销(token量降近50%)。这些策略依赖AI Gateway集中管理模型、预算和日志。对开发者而言,管理AI编码成本的关键是关注效率前沿,通过系统架构而非单纯谈判降价来控制人均成本。 核心观点: 1. 效率前沿推进快于智能前沿,最大杠杆是持续迁移到效率更高的新模型。 2. 动态路由(请求级/任务级/升级委派)可降成本30%+且质量持平最贵模型。 3. 削减Token开销(压缩上下文、话少harness等)实测token量降近50%质量无损。
核心观点提炼高信息密度,值得细读
正文内容概括Anthropic工程师分享构建自主运行Agent循环的方法,让Claude自动修复错误并持续工作,无需人工反复提示。
核心观点提炼常规快讯,保留列表
正文内容概括Amp 用 GPT-5.6 替换 Opus,使平均成本降低约 50% 且性能大幅提升。
核心观点提炼常规快讯,保留列表
正文内容概括Sakana AI 为其多智能体编排产品 Fugu 更新了基于 Gemma 4 的指挥者模型,在保持性能的同时降低了成本。
核心观点提炼常规快讯,保留列表
正文内容概括Ethan Mollick 让 GPT-5.6 Sol in Codex 控制其电脑并成功赢得游戏《Slay the Spire 2》的每日挑战,展示了 AI 代理的自主决策能力。
核心观点提炼常规快讯,保留列表
正文内容概括JT-4.1 Flash 在 AA-Omniscience 指数上得分为 -10.1,准确率 23%,幻觉率 43%。
核心观点提炼常规快讯,保留列表
正文内容概括Sakana AI 以 VLM-agent 非交互方式重现 Picbreeder,作者评论认为这是 AI 最重要研究方向之一,并指出 LLM 自动化面临收敛与抽象理解问题。
核心观点提炼常规快讯,保留列表
正文内容概括GPT-5.6 Sol Ultra 正式可用,Ethan Knight 称其用 64 个子代理在一小时内证明了 50 年未解的 Cycle Double Cover 猜想,而 Dan Shipper 则调侃自己花费 2b tokens 未能解决。
核心观点提炼常规快讯,保留列表
正文内容概括JT-4.1 Flash 作为非推理模型每个智能指数任务使用约 14k tokens,效率较高但未达到智能与输出 token 的帕累托前沿。
核心观点提炼常规快讯,保留列表
正文内容概括两个香港学生通过在外层循环上再套一个循环,将Karpathy的自动研究框架提速5倍,未更换模型或增加算力。
核心观点提炼常规快讯,保留列表
正文内容概括LangChain 分享了在 Deep Agents 中调优 Nemotron 3 Ultra 的实践,展示了如何通过调整智能体框架而非模型本身来提升性能。
核心观点提炼常规快讯,保留列表
正文内容概括GPT-5.6 在 DeepSWE 排行榜上以 73% 的成绩领先,并公布了 Sol、Terra 和 Luna 的结果。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 发布 ChatGPT Work 功能说明,指出云端与桌面工作数据隔离。
核心观点提炼常规快讯,保留列表
正文内容概括Magic Patterns 集成了 OpenAI 的 GPT-5.6,早期评估显示其 token 效率提升且设计能力优于 GPT-5.5。
核心观点提炼常规快讯,保留列表
正文内容概括ChatGPT 新版语音模式新增可视化卡片功能,在对话中展示搜索结果细节,提升交互体验。
核心观点提炼常规快讯,保留列表
正文内容概括GPT-5.6 Sol (max) 在由阿贡和UIUC开发的CritPt基准测试中超越前代和Claude Fable 5,成为研究生级物理问题的新领先者,显示其前沿科研潜力。
核心观点提炼常规快讯,保留列表
正文内容概括Cohere 发布基于 mlx-audio 的本地阿拉伯语转录功能,可在 MacBook 上运行,用于会议记录和语音笔记。
核心观点提炼常规快讯,保留列表
正文内容概括JetBrains 将 OpenAI 的 GPT 5.6 集成到其 IDE、Junie 和 Air 产品中,并演示了用模糊 CEO 消息快速构建实用工具的能力。
核心观点提炼常规快讯,保留列表
正文内容概括Replit 宣布现有项目可迁移至 Clerk 认证,并支持自定义注册体验,开发者可定制界面且用户无需 Replit 账户。
核心观点提炼常规快讯,保留列表
正文内容概括dotey 分享了 Agent 的 /goal 功能使用技巧,通过设定目标、验证和停止条件,实现长时间运行任务,并给出性能优化示例。
核心观点提炼常规快讯,保留列表
正文内容概括Claude Code 发布会话间通信功能,允许不同会话自主发送摘要以协调任务,避免重复解释,提升多会话协作效率。
核心观点提炼常规快讯,保留列表
正文内容概括Pika Labs 宣布 MiniMax 最新模型 H3 已在 Pika MCP 平台正式上线,开发者可立即集成使用,为 AI 应用开发提供新的能力和更多可能性。
核心观点提炼常规快讯,保留列表
正文内容概括Claude Code 将于下周默认开启自动模式,该模式通过多层防御将间接提示注入攻击降至接近零。
核心观点提炼常规快讯,保留列表
正文内容概括Addy Osmani 提出工程师应守住 AI 代码生成的外环问责,强调质量、裁决与可交代性,并指出信任-验证缺口与认知成本。
核心观点提炼常规快讯,保留列表
正文内容概括Justin Uberti 展示了 GPT-Live 作为队友玩 Taboo 游戏,体现了快速来回对话和同时听说能力。
核心观点提炼常规快讯,保留列表
本节暂无内容。
正文内容概括Vercel Labs 开源 Native SDK,保留 Web 声明式 UI 体验,用自研引擎替代浏览器/WebView 直接绘制到 OS 窗口。基于 Zig 实现 Elm 架构,dev 模式热重载约2秒,release 模式编译时解析,二进制仅几 MB。内置 automation server 和 CLI agent skills,支持 AI 智能体读取 accessibility 快照、驱动 widget。开发者可用声明式范式构建高性能原生桌面应用,并集成 AI 自动化。 核心观点: 1. Native SDK 采用 Zig 实现 Elm 架构(Model/Msg/update/View),dev 模式热重载约2秒,release 模式 markup 编译进二进制,体积仅几 MB。 2. 自研引擎直接绘制到 OS 窗口,无浏览器/WebView,通过结构性 identity 和 keyed 列表确保跨重建状态稳定。 3. 内置 automation server,任何 agent 可读取 accessibility 快照、驱动 widget、断言状态,CLI 自带 agent skills。
核心观点提炼高信息密度,值得细读
正文内容概括OpenAI 发布了 GPT-5.6 模型,在 Terminal-Bench 基准测试上达到 91.9% 的新纪录。该模型定价与 GPT-5.5 相同,为每百万 tokens 输入 5 美元、输出 30 美元。相比之下,Claude 的 Fable 模型被从订阅中移除并转向 API,成本更高(每百万 tokens 输入 10 美元、输出 50 美元)。这一发布对开发者意味着在保持成本不变的情况下获得了更强的终端任务性能。 核心观点: 1. GPT-5.6 在 Terminal-Bench 上达到 91.9%,创下新纪录。 2. GPT-5.6 定价与 GPT-5.5 相同,每百万 tokens 输入 5 美元、输出 30 美元。 3. Claude 的 Fable 模型 API 定价为每百万 tokens 输入 10 美元、输出 50 美元,是 GPT-5.6 的两倍。
核心观点提炼高信息密度,值得细读
正文内容概括Moonshot AI 开源了基于 CUTLASS 的高性能 Kimi Delta Attention 内核 FlashKDA,在 SM90+ GPU 上实现 1.72–2.22 倍 prefill 加速。该内核支持 bf16 输入、可变长度批处理,可无缝集成到 flash-linear-attention 库中,为开发者提供高效的注意力计算方案。 核心观点: 1. FlashKDA 在 prefill 阶段实现 1.72–2.22 倍加速(基于 H20 基准测试)。 2. 要求 SM90+ 架构、CUDA 12.9+ 和 PyTorch 2.4+。 3. 内核 API 要求 K=V=128,支持 bf16 输入和可变长度批处理。
核心观点提炼高信息密度,值得细读
正文内容概括DeepSeek 发布了 V4 Flash 正式版(DeepSeek-V4-Flash-0731),Agent 能力大幅提升,在 Terminal Bench 2.1 等多项基准测试中取得优异成绩(如 82.7)。该模型已在官方 API 上线,并支持 Codex API 格式,提供一键配置脚本,方便开发者快速集成。模型结构与预览版一致,仅重新进行了后训练,性能提升源于后训练优化。开发者可借此增强自动化任务能力。 核心观点: 1. 在 Terminal Bench 2.1 上得分 82.7,体现 Agent 能力显著提升。 2. 支持 Codex API 格式并提供一键配置脚本,简化集成流程。 3. 模型结构同预览版,仅后训练变化,性能提升来自后训练优化。
核心观点提炼高信息密度,值得细读
正文内容概括vista8 发布了基于 bento PPT 改造的 Skill,可输入主题自动生成可编辑协作的 HTML PPT。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 宣布向10万名学术研究人员免费提供ChatGPT高级模型访问,以加速科学发现。
核心观点提炼常规快讯,保留列表
正文内容概括MCP协议发布重大版本,核心从有状态双向改为无状态请求/响应,每个请求独立携带版本和客户端信息,可负载到任意实例,使服务器能像HTTP服务部署,便于负载均衡和serverless。同时引入MRTR处理用户输入确认,请求头新增字段便于路由鉴权,授权加固。废弃部分功能但提供12个月过渡期。四个一级SDK同步更新,AWS、Microsoft、Cloudflare、Google Cloud等支持。开发者需评估迁移成本,但SDK团队已简化流程。 核心观点: 1. 协议改为无状态请求/响应,每个请求独立携带版本和客户端信息,可负载均衡,支持serverless部署。 2. MRTR允许服务端返回“需要输入”状态,客户端带用户回答重新请求,解决中途确认问题。 3. 请求头新增Mcp-Method和Mcp-Name,网关可直接根据请求头路由鉴权,无需解析JSON体。
核心观点提炼高信息密度,值得细读
正文内容概括Anthropic CEO Dario Amodei 发文澄清公司不主张全面禁止开放权重模型,但支持对芯片出口、工业级蒸馏和强制安全测试进行管控,为AI政策讨论提供明确立场。
核心观点提炼常规快讯,保留列表
正文内容概括月之暗面兑现承诺,正式开放Kimi k3模型权重,开发者可获取并使用该模型。
核心观点提炼常规快讯,保留列表
正文内容概括移动端AI Agent开发面临系统集成和工具调用限制。OpenMinis发布开源AI Agent,在iOS和Android上通过Linux沙箱实现系统级集成:iOS使用iSH深度定制fork(ARM64 guest),Android使用PRoot。模型仅暴露8个核心工具,设备功能通过沙箱内CLI命令调用,采用Native Offloads机制降低token消耗。支持Skills兼容、记忆分层、权限控制等设计。为移动AI Agent开发提供新思路,降低开发门槛,提高模型可控性和效率。 核心观点: 1. iOS端用iSH深度定制fork(OpenMinis/ish-arm64),改造为ARM64 guest,配合Asbestos JIT解释器,实现进程管理和100+系统调用。 2. 模型仅见8个工具(shell_execute等),20+设备集成通过沙箱CLI命令,Native Offloads将execve()路由到宿主侧原生handler。 3. Agent循环最多200轮,并发工具执行上限10,分级自动压缩与上下文卸载,并设有ToolLoopDetector熔断器。
核心观点提炼高信息密度,值得细读
摘要由 LLM 生成,请以原文为准。