OpenAI 演示了通过文本指令生成3D场景的能力,无需编写代码或上传资产,展示了AI的自主创作潜力
正文内容概括OpenAI 演示了通过文本指令生成3D场景的能力,无需编写代码或上传资产,展示了AI的自主创作潜力。
核心观点提炼常规快讯,保留列表
这期 AIWatch 月度回顾围绕「product、technology、Agent」整理本月最值得复盘的模型、产品、工程与行业变化。聚焦 30 · 关注 1 · 跟进 10。
如果只想快速复盘本月变化,先读:OpenAI 演示了通过文本指令生成3D场景的能力,无需编写代码或上传资产,展示了AI的自主创作潜力 → Claude 开发者官方分享:团队内部高频使用这两种经典多智能体模式「Advisor」和「Orchestrator」来发挥 Fable 5 最高价值、同时把成本降到最低! # 模式一:Advi... → OpenAI 发布了新一代语音模型 GPT-Live,用于增强 ChatGPT 语音交互的自然度。
本月回看「product、technology、Agent」,更重要的是判断哪些变化会沉淀为长期基础设施。
正文内容概括OpenAI 演示了通过文本指令生成3D场景的能力,无需编写代码或上传资产,展示了AI的自主创作潜力。
核心观点提炼常规快讯,保留列表
正文内容概括Claude 开发者团队分享了两种多智能体模式:Advisor(顾问)模式和 Orchestrator(编排者)模式,通过组合 Sonnet 5 和 Fable 5 实现接近顶级模型性能并大幅降低成本。Advisor 模式中 Sonnet 5 作为执行者,低频率调用 Fable 5 获取建议,在 SWE-bench Pro 上达到 Fable 5 约 92% 的性能,成本仅约 63%。Orchestrator 模式中 Fable 5 作为编排者规划并委派任务给多个 Sonnet 5 worker,在 BrowseComp 上达到 Fable 5 约 96% 的性能,成本仅约 46%。开发者可根据任务类型选择模式以优化性价比。 核心观点: 1. Advisor 模式在 SWE-bench Pro 上以 $1.40 成本实现 ~84% 准确率,相比纯 Fable 5 的 $2.25 成本节省约 37%。 2. Orchestrator 模式在 BrowseComp 上以 $18.53 成本实现 86.8% 准确率,相比纯 Fable 5 的 $40.56 成本节省约 54%。 3. Orchestrator 模式相比纯 Sonnet 5 准确率提升约 9 个百分点,成本仅增加约 $2.5。
核心观点提炼高信息密度,值得细读
正文内容概括DeepSeek V4-Flash 据报告以 105 倍更低总成本完成与 Fable 5 相同的基准任务,被视为 DeepSeek 2.0 时刻,将引起行业震动。
核心观点提炼常规快讯,保留列表
正文内容概括Vercel Labs 开源 Native SDK,保留 Web 声明式 UI 体验,用自研引擎替代浏览器/WebView 直接绘制到 OS 窗口。基于 Zig 实现 Elm 架构,dev 模式热重载约2秒,release 模式编译时解析,二进制仅几 MB。内置 automation server 和 CLI agent skills,支持 AI 智能体读取 accessibility 快照、驱动 widget。开发者可用声明式范式构建高性能原生桌面应用,并集成 AI 自动化。 核心观点: 1. Native SDK 采用 Zig 实现 Elm 架构(Model/Msg/update/View),dev 模式热重载约2秒,release 模式 markup 编译进二进制,体积仅几 MB。 2. 自研引擎直接绘制到 OS 窗口,无浏览器/WebView,通过结构性 identity 和 keyed 列表确保跨重建状态稳定。 3. 内置 automation server,任何 agent 可读取 accessibility 快照、驱动 widget、断言状态,CLI 自带 agent skills。
核心观点提炼高信息密度,值得细读
正文内容概括OpenAI 发布了 GPT-5.6 模型,在 Terminal-Bench 基准测试上达到 91.9% 的新纪录。该模型定价与 GPT-5.5 相同,为每百万 tokens 输入 5 美元、输出 30 美元。相比之下,Claude 的 Fable 模型被从订阅中移除并转向 API,成本更高(每百万 tokens 输入 10 美元、输出 50 美元)。这一发布对开发者意味着在保持成本不变的情况下获得了更强的终端任务性能。 核心观点: 1. GPT-5.6 在 Terminal-Bench 上达到 91.9%,创下新纪录。 2. GPT-5.6 定价与 GPT-5.5 相同,每百万 tokens 输入 5 美元、输出 30 美元。 3. Claude 的 Fable 模型 API 定价为每百万 tokens 输入 10 美元、输出 50 美元,是 GPT-5.6 的两倍。
摘要由 LLM 生成,请以原文为准。
正文内容概括OpenAI 发布了新一代语音模型 GPT-Live,旨在提升 ChatGPT 语音交互的自然度。该模型现已用于 ChatGPT Voice 功能,为开发者提供了更流畅、更接近真人对话的语音交互能力。
核心观点提炼高信息密度,值得细读
正文内容概括Google 在 Flash 系列基础上发布 Gemini 3.7 Flash,专为编码和智能体任务优化。相比 3.6 Flash,在代码生成、Web 开发、知识工作等基准测试上显著提升,如 FrontierCode 1.1 从 34.4% 升至 43.6%,WebDev Arena Elo 从 1538 升至 1588。同时推出半价优惠,输入 $0.75/1M tokens,输出 $3.75/1M tokens,使开发者能更经济地扩展生产级智能体。模型已集成到 Gemini Spark 等产品中。 核心观点: 1. Gemini 3.7 Flash 在 FrontierCode 1.1 Main 上达 43.6%,较 3.6 Flash 的 34.4% 提升 9.2 个百分点。 2. 在 WebDev Arena 中 Elo 得分从 1538 升至 1588,生成更功能完整的 Web 应用。 3. AutomationBench 得分从 17.0% 升至 30.4%,企业工作流自动化能力显著增强。
核心观点提炼高信息密度,值得细读
正文内容概括Meta发布了Muse Glimmer开放权重模型(30B参数,Apache 2.0),专为本地代理设计,支持复杂多步骤任务。
核心观点提炼常规快讯,保留列表
正文内容概括Frank Coyle在AIEWF演讲中主张利用本体论作为LLM代理的逻辑护栏,推动神经符号AI复兴。
核心观点提炼常规快讯,保留列表
正文内容概括Augment Code 将 Kimi K3 开源模型集成到其产品家族,用户可在 Cosmos 代理编排平台中尝试。
核心观点提炼常规快讯,保留列表
正文内容概括Runway 宣布 Seedance 2.5 即将在其平台上线,带来视频生成能力的升级。
核心观点提炼常规快讯,保留列表
正文内容概括一项研究测试44个模型发现,要求输出JSON或XML会降低大模型回答的多样性,建议避免使用结构化输出格式以保持丰富性。
核心观点提炼常规快讯,保留列表
正文内容概括Dash 发布了开源 AI Agent 客户端 Cindy,称其完全由 AI 生成,目前尚不完善但将持续改进,面向 AI 原生开发。
核心观点提炼低价值或偏离 AI-Dev
正文内容概括Sumanth_077 指出 MCP 仅解决连接层,上下文仍碎片化;Glean 通过预计算统一索引和知识图谱,使 Agent 上下文偏好提升 2.5 倍并节省 30% token。
核心观点提炼常规快讯,保留列表
正文内容概括AYi指出Ling-3.0-flash模型悄然上线OpenRouter,性能媲美旗舰模型但成本减半,建议分层使用模型以降低执行成本。
核心观点提炼常规快讯,保留列表
正文内容概括月之暗面在Reddit AMA中确认,其发布的MXFP4量化格式与托管API使用的格式完全相同,自托管推理质量与API一致。
核心观点提炼常规快讯,保留列表
正文内容概括Vercel AI Gateway 宣布 Kimi K3 模型现可通过美国提供商使用,支持零数据保留和区域推理,并提供代码示例。
核心观点提炼常规快讯,保留列表
正文内容概括Fireworks AI 宣布在其平台上提供 Kimi K3 模型,强调开源加速创新。
核心观点提炼常规快讯,保留列表
正文内容概括Hugging Face 为 Moonshot AI 的 Kimi K3 模型开设开源预告倒计时页面,预示该模型即将开源。
核心观点提炼常规快讯,保留列表
正文内容概括llm 0.33 发布,升级 OpenAI 库与 HTTP 依赖,嵌入命令支持 --key,模板可组合,新增 reasoning_summary 选项。
核心观点提炼常规快讯,保留列表
正文内容概括Bento 发布了一款开源的 PowerPoint 替代品,以单一 HTML 文件实现自包含的演示文稿编辑与播放,并支持 AI 直接编辑文档 JSON。
核心观点提炼常规快讯,保留列表
正文内容概括Latent Space 指出 AI 流水线中人类组件正被模型模拟取代,合成数据与模拟环境成为主流,使成本降低百倍、速度提升万倍。
核心观点提炼常规快讯,保留列表
正文内容概括Unsloth Studio 新增对 AMD 硬件的支持,两天内完成 30 次提交,加速推进兼容性。
核心观点提炼常规快讯,保留列表
正文内容概括Anthropic 用 Claude Code 在两周内完成百万行代码迁移,成本仅 16.5 万美元,并提炼出可复制的六步流程和反常识原则。
核心观点提炼常规快讯,保留列表
正文内容概括Amp 发布了 Orbs 的多人协作功能,允许团队与 AI 代理在同一工作单元中协同工作。
核心观点提炼常规快讯,保留列表
正文内容概括Matt Pocock 发布了 /wayfinder 技能,通过“战争迷雾”概念帮助开发者在项目规划阶段管理不确定性,自动协调多个规划会话。
核心观点提炼常规快讯,保留列表
正文内容概括Codepilot 预告新版本将允许用户为每个 SubAgent 指定不同模型(如 Grok、DeepSeek、Kimi),以发挥各模型特长。
核心观点提炼常规快讯,保留列表
正文内容概括Jie Tang提出后训练缩放定律新观点,强调参数计数需结合数据、计算和运行条件,并介绍GLM 5.3通过合成RL环境取得重大进展。
核心观点提炼常规快讯,保留列表
正文内容概括腾讯混元发布了首个研究代理Hyra-1.0,可递归改进解决方案,用于性能驱动的研究和工程任务。
核心观点提炼常规快讯,保留列表
正文内容概括Sakana AI 发布了 Fugu-Cyber 模型,在真实世界安全基准上达到最先进性能,匹配 GPT-5.5-Cyber 等前沿模型。
核心观点提炼常规快讯,保留列表
正文内容概括AI周报播客第248期回顾了Claude Fable 5发布、苹果Siri AI、OpenAI与Anthropic IPO竞赛、Gemma 4开源模型及多项AI安全政策动态。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 重申为符合条件的 API 客户提供零数据保留,并预览私有安全处理以在不牺牲数据隐私的前提下实现高级 AI 安全。
核心观点提炼常规快讯,保留列表
正文内容概括Replit 发布了由 GPT-5.6 Luna 驱动的 Free Mode,让用户无需担心 token 成本即可将想法转化为可运行的软件。
核心观点提炼常规快讯,保留列表
核心观点提炼高信息密度,值得细读
正文内容概括Moonshot AI 开源了基于 CUTLASS 的高性能 Kimi Delta Attention 内核 FlashKDA,在 SM90+ GPU 上实现 1.72–2.22 倍 prefill 加速。该内核支持 bf16 输入、可变长度批处理,可无缝集成到 flash-linear-attention 库中,为开发者提供高效的注意力计算方案。 核心观点: 1. FlashKDA 在 prefill 阶段实现 1.72–2.22 倍加速(基于 H20 基准测试)。 2. 要求 SM90+ 架构、CUDA 12.9+ 和 PyTorch 2.4+。 3. 内核 API 要求 K=V=128,支持 bf16 输入和可变长度批处理。
核心观点提炼高信息密度,值得细读
正文内容概括OpenRouter 宣布 GPT-5.6 模型上线,提供 Sol、Terra 和 Luna 三种变体,早期测试显示其 token 效率更高、成本更低。
核心观点提炼常规快讯,保留列表
正文内容概括Google 工程负责人 Addy Osmani 开源了 Agent Skills 项目,旨在解决 AI 编码智能体默认走捷径、产出不可靠代码的问题。该项目将资深工程师的生产级工程纪律固化为一个六阶段生命周期(DEFINE → PLAN → BUILD → VERIFY → REVIEW → SHIP)和 24 个可执行的技能,强制智能体遵循规格、测试、评审等流程。对开发者而言,这提供了一套可复用的工程化框架,能显著提升 AI 生成代码的质量与可靠性。 核心观点: 1. doubt-driven-development 技能通过 CLAIM → EXTRACT → DOUBT → RECONCILE → STOP 流程,针对高代价决策进行对抗性复盘,并支持跨模型升级。 2. source-driven-development 技能要求框架决策必须引用官方文档并标注未验证项,直接对抗 LLM 编造 API 的问题。 3. deprecation-and-migration 技能将代码视为负债,并配套强制与建议性弃用模式及僵尸代码清除机制。
核心观点提炼高信息密度,值得细读
正文内容概括OpenAI 于6月26日发布 GPT-5.6 系列模型,包含旗舰级 Sol、日常级 Terra 和经济级 Luna。因美国政府要求,目前仅向约20家经审批的合作伙伴开放预览。Sol 新增 max 深度推理与 ultra 多子 Agent 并行模式,在 Terminal-Bench 2.1 上 Sol Ultra 得分 91.9%。Terra 性能接近上一代 GPT-5.5 但价格减半,Luna 主打低成本高吞吐。7月将上线 Cerebras 硬件加速版本,推理速度达每秒750 token。对开发者而言,Terra 的高性价比和 Sol 的 ultra 模式值得关注。 核心观点: 1. Sol Ultra 在 Terminal-Bench 2.1 上得分 91.9%,高于 Claude Mythos 5 的 88% 和 Gemini 3.1 Pro Preview 的 70.7%。 2. Sol 在 ExploitBench 上用约三分之一的 token 达到 Mythos Preview 的网络安全水平。 3. Sol 的 ultra 模式可调用多个子 Agent 并行处理复杂任务,无需开发者自行搭建 Agent 编排框架。
核心观点提炼高信息密度,值得细读
正文内容概括OpenAI 预览了下一代模型 GPT-5.6 Sol,该模型在编程、科学和网络安全方面能力更强,并配备了最先进的安全栈。对开发者而言,这意味着更强的代码生成与科学推理能力,同时安全机制得到升级。
核心观点提炼重磅首发或硬核洞察
正文内容概括Anthropic 发布面向科学家的 AI 工作台 Claude Science(Beta),集成 60+ 预配置技能与数据库(如 UniProt、PDB、Ensembl),支持基因组学、蛋白质组学等科研任务。该平台将分散工具整合为统一环境,产出可审计、可复现的科研产物(含 3D 蛋白结构、化学结构等),并管理本地或云端计算资源(HPC、Modal)。对开发者/研究者而言,它降低了多工具切换与计算管理的复杂度,并支持通过 NVIDIA BioNeMo 连接生命科学模型。 核心观点: 1. Claude Science 内置 reviewer agent,可自动检查引用、计算错误并自我修正。 2. 平台支持 fork 会话以并行比较不同实验路径,且上下文在运行会话中持续保留。 3. 通过 NVIDIA BioNeMo Agent Toolkit 原生连接 Evo 2、Boltz-2、OpenFold3 等生命科学模型。
核心观点提炼高信息密度,值得细读
正文内容概括Anthropic 推出 Claude Tag,一种在 Slack 中通过 @Claude 标签让团队协作使用 AI 的新方式。它支持多用户共享上下文、异步任务和主动提醒,管理员可精细控制工具和数据访问权限。目前以 beta 形式面向 Claude Enterprise 和 Team 客户开放,旨在将 Claude Code 的协作模式扩展到更广泛的团队场景。 核心观点: 1. Claude Tag 在 Slack 中实现多用户共享同一 Claude 实例,支持上下文记忆和异步任务。 2. Anthropic 内部产品团队 65% 的代码由内部版 Claude Tag 生成。 3. Claude Tag 基于 Opus 4.8 模型,支持管理员设置 token 限额和操作日志。
核心观点提炼高信息密度,值得细读
正文内容概括DeepSeek 发布了 V4 Flash 正式版(DeepSeek-V4-Flash-0731),Agent 能力大幅提升,在 Terminal Bench 2.1 等多项基准测试中取得优异成绩(如 82.7)。该模型已在官方 API 上线,并支持 Codex API 格式,提供一键配置脚本,方便开发者快速集成。模型结构与预览版一致,仅重新进行了后训练,性能提升源于后训练优化。开发者可借此增强自动化任务能力。 核心观点: 1. 在 Terminal Bench 2.1 上得分 82.7,体现 Agent 能力显著提升。 2. 支持 Codex API 格式并提供一键配置脚本,简化集成流程。 3. 模型结构同预览版,仅后训练变化,性能提升来自后训练优化。
核心观点提炼高信息密度,值得细读