Cursor团队通过从零实现SQLite的实验,验证了Agent Swarm中上下文分工和模型组合的经济性。新harness显著优于旧:Grok 4.5新系统4小时达80%,旧系统不到2小时失控。架构为树形:强模型Planner拆分决策,便宜模型Worker执行。可扩展性来自上下文效率而非并行,协调成本是瓶颈。模型组合质量接近时成本差一个数量级($1,339 vs $20,057),优化策略是frontier仅用于高熵决策。实验还揭示了五类失败模式。对开发者:Harness设计、上下文分工和成本优化是关键。 核心观点: 1. 新harness在所有模型配置下更好,Grok 4.5新系统4小时约80%,旧系统不到2小时失控。 2. 不同模型mix质量接近,费用差极大:Opus planner+Composer worker成本$1,339,全程Fable $20,057。 3. 可扩展性主要来自上下文效率,planner不写实现、worker不规划,各自专注上下文。
单Agent处理大任务时瓶颈从模型智力转向协调成本与上下文经济学。Cursor团队用树形swarm架构(Planner强模型+Worker便宜模型)从零实现SQLite,通过自研VCS、Review lenses、Field Guide等机制,使成本降低一个数量级(Opus规划+Composer执行总成本$411 vs 全程Fable $20,057),质量接近(新系统4小时达73%-85%)。验证了上下文分工和模型组合经济学,提示开发者应关注协调工程,成本优化主杠杆是frontier只做高熵决策。 核心观点: 1. 树形swarm架构使冲突从7万+降至<1000,代码量从64305行降至9908行。 2. Opus规划+Composer执行总成本$411,而全程Fable成本$20,057,质量接近。 3. 新系统4小时冲突<1000、包结构9 crates,旧系统commits多但thrash严重,协调成本是瓶颈。
Cursor团队发现公共基准与开发者实际体验脱节,自研CursorBench。Claude Fable 5在CursorBench上取得72.9%高分,并在实际工程测试中展现全局推理能力,能理解模糊任务意图,无需反复引导。这显著提升开发效率,降低复杂任务门槛,使团队能处理之前搁置的项目,并改变协作方式。 核心观点: 1. Claude Fable 5在CursorBench上达到72.9%准确率(Max effort),创下新高。 2. 在登月模拟实验中,Fable 5通过全局推理成功登月,而Opus仅局部推理失败。 3. Schmidt团队将Fable 5与轻量模型结合,用于最难问题,优化时间成本。
针对Claude Fable 5等前沿模型的高成本问题,本文提出了一种成本高效的Harness设计方法。核心思路是利用任务中token智能需求的不对称性,仅在关键位置使用Fable 5等前沿模型,其余部分委派给廉价模型。通过Orchestrator、Advisor、Verifier三种分配模式,在Parameter Golf和BrowseComp实验中,以约46%的成本实现了约90%的性能。文章总结了四条设计准则,包括审视任务形状、使用委派启发式、评估协调成本和保证prompt cache命中,为开发者提供了构建经济高效AI系统的实用框架。 核心观点: 1. Parameter Golf实验表明,前置规划无效,Fable 5的真正价值在于中段检查点提供方向纠偏与重新排序。 2. BrowseComp实验中,Fable 5编排+Sonnet worker在完整集(~31M tokens/题)上实现了96%分数/46%成本的套利。 3. 协调成本的两大来源是边界重复(跨模型token计费至少两次)和扇出重叠(worker互不通信、研究范围部分重合)。
Claude 开发者团队分享了两种多智能体模式:Advisor(顾问)模式和 Orchestrator(编排者)模式,通过组合 Sonnet 5 和 Fable 5 实现接近顶级模型性能并大幅降低成本。Advisor 模式中 Sonnet 5 作为执行者,低频率调用 Fable 5 获取建议,在 SWE-bench Pro 上达到 Fable 5 约 92% 的性能,成本仅约 63%。Orchestrator 模式中 Fable 5 作为编排者规划并委派任务给多个 Sonnet 5 worker,在 BrowseComp 上达到 Fable 5 约 96% 的性能,成本仅约 46%。开发者可根据任务类型选择模式以优化性价比。 核心观点: 1. Advisor 模式在 SWE-bench Pro 上以 $1.40 成本实现 ~84% 准确率,相比纯 Fable 5 的 $2.25 成本节省约 37%。 2. Orchestrator 模式在 BrowseComp 上以 $18.53 成本实现 86.8% 准确率,相比纯 Fable 5 的 $40.56 成本节省约 54%。 3. Orchestrator 模式相比纯 Sonnet 5 准确率提升约 9 个百分点,成本仅增加约 $2.5。
腾讯正式开源 Hy3 模型,采用 295B/A21B MoE 架构与 256K 上下文窗口。相比预览版,任务成功率从 72% 提升至 90%,执行效率平均缩短 34%,文档处理 token 节省 47.4%,PPT 制作节省 49.0%(对比 GLM-5.2)。该模型已在元宝、ima、QQ 浏览器、微信读书、腾讯文档等产品中应用,形成数据循环强化。对开发者而言,Hy3 开源提供了高性价比的 MoE 大模型选择。 核心观点: 1. Hy3 采用 295B/A21B MoE 架构,上下文窗口达 256K。 2. 相比 Hy3 preview,任务成功率从 72% 提升至 90%,执行效率平均缩短 34%。 3. 文档处理 token 节省 47.4%,PPT 制作节省 49.0%(对比 GLM-5.2)。
Anthropic 发布 Claude Sonnet 5,定位为 Agent 能力接近旗舰 Opus 4.8 但价格仅为其 40% 的模型。在 Agent 编程基准上 Sonnet 5 得分 63.2%,高于前代 Sonnet 4.6 的 58.1%,低于 Opus 4.8 的 69.2%;知识工作基准甚至略超 Opus 4.8。模型更换了新分词器,同样文本可能消耗 1.0-1.35 倍 Token,但推广期定价已对冲此涨幅。对开发者而言,Sonnet 5 提供了更优的性价比,但需注意推广期结束后实际花费涨幅可能高于标价涨幅。 核心观点: 1. Sonnet 5 在 Agent 编程基准得分 63.2%,Sonnet 4.6 为 58.1%,Opus 4.8 为 69.2%。 2. 新分词器导致同样文本消耗 1.0-1.35 倍 Token,推广期定价已对冲此涨幅。 3. API 推广价(至 8 月 31 日)为输入 $2/百万 Token、输出 $10/百万 Token,之后涨至 $3 和 $15。
Anthropic 发布了 Claude Sonnet 5,这是其最具智能体能力的 Sonnet 模型。该模型能够自主制定计划,并使用浏览器和终端等工具,其自主运行水平接近数月前需要更大、更昂贵模型才能达到的程度。这对开发者意味着可以以更低成本实现更复杂的自动化任务。 核心观点: 1. Claude Sonnet 5 具备自主规划能力,并能使用浏览器和终端等工具。 2. 该模型的自主运行效率接近此前需要更大、更昂贵模型才能达到的水平。
Anthropic 发布 Claude Sonnet 5,定位为迄今最具智能体能力的 Sonnet 模型,在推理、工具使用和编码方面显著提升,性能接近 Opus 4.8 但价格更低。该模型已全面上线,成为 Free 和 Pro 计划的默认模型,并可通过 Claude API 使用。开发者可调整 effort 级别以平衡成本与性能,对构建复杂多步任务的智能体应用具有重要价值。 核心观点: 1. Sonnet 5 在 BrowseComp 和 OSWorld-Verified 等智能体评测中,通过调整 effort 级别可在部分任务上匹配 Opus 4.8 的性能。 2. Sonnet 5 引入新 tokenizer,输入 token 数约为之前的 1.0–1.35 倍,但通过定价调整实现大致成本中性。 3. Sonnet 5 的网络安全任务能力远低于当前 Opus 模型,整体不良行为率低于 Sonnet 4.6。
OpenAI 发布了 GPT-5.6 系列模型的有限预览,包括旗舰模型 Sol、均衡模型 Terra 和高效模型 Luna。Sol 作为下一代前沿模型,Terra 面向日常高效工作,Luna 则针对高容量任务提供快速且经济的方案。此次发布为开发者提供了不同性能与成本梯度的选择,有助于在具体应用中灵活部署。 核心观点: 1. GPT-5.6 系列包含三个模型:旗舰 Sol、均衡 Terra 和高效 Luna,分别面向前沿、日常和高容量场景。 2. Luna 被定位为快速且经济的模型,适合高吞吐量任务。
OpenAI 与 Broadcom 联合推出专为大语言模型推理优化的定制芯片 Jalapeño,旨在提升 AI 系统的性能、效率和可扩展性。该芯片针对 LLM 推理场景进行专门设计,有望降低推理成本并提高响应速度,对开发者和研究者而言,意味着未来可能获得更高效、更低成本的 AI 推理基础设施。
Z ai 发布 GLM-5.2 开源模型,总参数 744B,激活参数 40B,在 Artificial Analysis Intelligence Index v4.1 上得分 51,领先于 MiniMax-M3 和 DeepSeek V4 Pro。相比 GLM-5.1,科学推理能力显著提升,CritPt 提高 16 分,HLE 提高 12 分。模型位于智能与成本帕累托前沿,每任务成本约 $0.46。上下文窗口扩展至 1M tokens,采用 MIT 许可证。开发者可通过 Z ai 官方 API 及多家第三方提供商使用。 核心观点: 1. GLM-5.2 在 Intelligence Index v4.1 得分 51,领先 MiniMax-M3 (44) 和 DeepSeek V4 Pro (44)。 2. 科学推理提升显著:CritPt +16 分至 21%,HLE +12 分至 40%。 3. 每任务输出 tokens 43k,高于 GLM-5.1 的 26k,成本 $0.46/任务。
OpenRouter 发布了 Fusion API,这是一种服务端多模型并行推理系统。它将用户提示并行发送给多个模型,允许它们使用网络搜索和 bash 工具,然后由法官模型比较答案,合成器生成最终回答。OpenRouter 声称 Fusion 在 Perplexity 的 DRACO 深度研究基准测试上超越了前沿模型,且成本更低,达到 Fable 级智能但价格减半。这对开发者意味着一种新的低成本、高智能的模型组合调用方式。 核心观点: 1. Fusion 通过并行调用多个模型并引入法官与合成器机制,在 DRACO 基准上声称超越前沿模型。 2. Fusion 声称达到 Fable 级智能但价格减半,为开发者提供低成本高智能的替代方案。
xAI 发布 Grok Voice Think Fast 1.0 语音 API,在 EVA-Bench 评测中达到帕累托前沿,没有任何系统能在不牺牲体验时取得更高准确性,反之亦然。其具备类人时机、语调与温暖感,且定价仅为竞争对手的一小部分。开发者可在语音智能体场景中,以显著降低的成本获得无需权衡准确度与体验的商用语音交互能力。 核心观点: 1. Grok Voice Think Fast 1.0 在 EVA-Bench 达帕累托前沿,无系统能在不牺牲体验时击败其准确性,反之亦然。 2. Grok Voice Think Fast 1.0 定价为竞争对手一个 fraction,并提供类人时机、语调和温暖感。
OpenRouter在其定价页面新增功能,支持查看不同模型提供商的实时缓存命中率、历史流量及有效价格,帮助用户优化模型调用成本。目前已支持Claude Opus 4.8等模型。