Cursor团队发现公共基准与开发者实际体验脱节,自研CursorBench。Claude Fable 5在CursorBench上取得72.9%高分,并在实际工程测试中展现全局推理能力,能理解模糊任务意图,无需反复引导。这显著提升开发效率,降低复杂任务门槛,使团队能处理之前搁置的项目,并改变协作方式。 核心观点: 1. Claude Fable 5在CursorBench上达到72.9%准确率(Max effort),创下新高。 2. 在登月模拟实验中,Fable 5通过全局推理成功登月,而Opus仅局部推理失败。 3. Schmidt团队将Fable 5与轻量模型结合,用于最难问题,优化时间成本。
Anthropic 发布 Claude Sonnet 5,定位为 Agent 能力接近旗舰 Opus 4.8 但价格仅为其 40% 的模型。在 Agent 编程基准上 Sonnet 5 得分 63.2%,高于前代 Sonnet 4.6 的 58.1%,低于 Opus 4.8 的 69.2%;知识工作基准甚至略超 Opus 4.8。模型更换了新分词器,同样文本可能消耗 1.0-1.35 倍 Token,但推广期定价已对冲此涨幅。对开发者而言,Sonnet 5 提供了更优的性价比,但需注意推广期结束后实际花费涨幅可能高于标价涨幅。 核心观点: 1. Sonnet 5 在 Agent 编程基准得分 63.2%,Sonnet 4.6 为 58.1%,Opus 4.8 为 69.2%。 2. 新分词器导致同样文本消耗 1.0-1.35 倍 Token,推广期定价已对冲此涨幅。 3. API 推广价(至 8 月 31 日)为输入 $2/百万 Token、输出 $10/百万 Token,之后涨至 $3 和 $15。
OpenAI 发布了完整版 GPT-5.5-Cyber,在 CyberGym 基准测试上达到最先进性能。该模型旨在提升企业安全,并与美国政府及安全生态系统合作,通过 Patch The Planet 和 Codex Security 等工具从发现安全问题转向解决安全问题。对开发者而言,这意味着可部署更强大的安全专用模型。
智谱AI发布GLM-5.2模型,在移动应用开发能力上实现大幅提升。内部基准测试包含35个挑战性移动开发任务,每个任务运行两次共70次试验,以核心功能无重大问题为完成标准。GLM-5.2完成率从GLM-5.1的21/70提升至48/70,提升超过两倍,但仍低于Claude Fable 5的56/70。对开发者而言,该模型在长周期任务上的进步值得关注。 核心观点: 1. GLM-5.2在内部移动开发基准测试中完成率从21/70提升至48/70,提升超过两倍。 2. 基准测试包含35个挑战性移动开发任务,每个任务运行两次共70次试验。 3. Claude Fable 5在该基准上完成率为56/70,高于GLM-5.2。
Artificial Analysis 发布 AA-Briefcase 基准测试,用于评估模型在长期、多步骤知识工作项目中的能力。测试场景由行业专家设计,包含数千输入文件(如 Slack 消息、邮件)。Claude Fable 5 以 1587 Elo 领先,但每任务成本约 $31;开源模型 GLM-5.2 以约 $2.40 成本取得 1266 Elo,性价比突出。所有模型在真实复杂任务中表现仍有限,顶级模型仅 3% 任务满足全部标准。 核心观点: 1. Claude Fable 5 在 AA-Briefcase 上以 1587 Elo 领先,未使用 Opus 4.8 回退。 2. GLM-5.2 (max) 以 $2.40 成本取得 1266 Elo,性价比优于 Claude Opus 4.8。 3. 所有模型在 91 个任务中仅 3% 满足全部 rubric 标准,31 个任务无模型得分超 50%。
智谱AI在ModelScope发布GLM-5.2模型,支持100万上下文窗口,并显著提升编码能力。该模型在Code Arena全球可用模型中排名第二,在FrontierSWE、SWE-Marathon和PostTrainBench等基准上成为排名最高的开源模型,性能介于Claude Opus 4.7和4.8之间。GLM-5.2采用KV8、LayerSplit、IndexShare等技术实现百万上下文,在Terminal-Bench 2.1上达到开源SOTA,较GLM-5.1提升17.5%。开发者可使用vLLM、SGLang、Transformers进行推理部署。 核心观点: 1. GLM-5.2在Code Arena全球所有可用模型中排名第二。 2. 在Terminal-Bench 2.1上达到开源SOTA,较GLM-5.1提升17.5%。 3. 采用KV8、LayerSplit、IndexShare技术实现100万上下文窗口。
OpenAI 发布了 LifeSciBench,这是一个由领域专家编写和审核的基准测试,旨在评估 AI 系统处理真实生命科学研究任务与决策的能力。该基准对开发者而言,提供了更贴近实际科研场景的评测标准,有助于推动 AI 在生命科学领域的应用与改进。
DeepInfra 上线了智谱 AI 的 GLM-5.2 模型。该模型采用 744B/40B MoE 架构,MIT 许可,支持 1M 上下文窗口。在 FrontierSWE、PostTrainBench 和 SWE-Marathon 基准测试中,GLM-5.2 表现领先于其他开源模型。DeepInfra 提供该模型的 API 服务,定价为每百万 token 输入 $1.40、输出 $4.40、缓存 $0.25。开发者可通过 DeepInfra 平台直接调用该模型。 核心观点: 1. GLM-5.2 采用 744B/40B MoE 架构,支持 1M 上下文窗口,MIT 许可。 2. 在 FrontierSWE、PostTrainBench、SWE-Marathon 三项基准中,GLM-5.2 为表现最佳的开源模型。 3. DeepInfra 定价:输入 $1.40/1M tokens,输出 $4.40/1M tokens,缓存 $0.25/1M tokens。
Parasail 平台上线了 GLM-5.2 开放权重模型。该模型在长周期智能体任务上首次显著缩小了与闭源前沿模型的差距,在 FrontierSWE 基准测试中得分超过 GPT-5.5,仅次于 Opus 4.8。这为开发者提供了一个在复杂智能体工作流中接近顶级闭源性能的开源选择。 核心观点: 1. GLM-5.2 在 FrontierSWE 基准上超越 GPT-5.5,仅次于 Opus 4.8。 2. 该模型是首个在长周期智能体任务上接近闭源前沿的开放权重模型。
Kimi 发布并开源了 K2.7-Code 模型,针对编码智能体常见的“过度思考”问题进行了优化,相比上一代减少 30% token 消耗。在多项基准测试中性能显著提升:Kimi Code Bench v2 提高 21.8%,Program Bench 提高 11%,MLS Bench Lite 提高 31.5%。模型权重和代码已开源至 Hugging Face,同时预告了即将推出的 6x 高速模式。开发者可通过开放 API 和 Kimi Code 立即使用,并参与 Beta 计划体验新功能。 核心观点: 1. K2.7-Code 通过减少过度思考,在长任务智能体场景下 token 消耗降低 30%,同时 agent 长任务成功率反而提升。 2. Kimi Code Bench v2 提升 21.8%、Program Bench 提升 11%、MLS Bench Lite 提升 31.5%,指令跟随和端到端完成率均有改善。 3. 模型权重和代码已开源至 Hugging Face,并预告即将推出 6x High-Speed Mode 以进一步提升编码效率。
腾讯混元联合上海交通大学、新加坡南洋理工大学等多所高校发布MMAE,这是首个大规模多任务音频编辑基准。MMAE要求AI理解现有音频并根据自然语言指令精确修改,而非简单生成。基准包含2000个真实场景样本、17741个细粒度评估项,覆盖7种模态、6级任务复杂度、8种操作类型。当前模型精确匹配率(EMR)低于5%,揭示了可靠音频编辑能力的重大缺口,为开发者提供了明确的评测标准。 核心观点: 1. MMAE包含2000个高保真样本和17741个细粒度评估项,覆盖声音、音乐、语音及其混合共7种模态。 2. 当前模型在MMAE上的精确匹配率(EMR)低于5%,表明音频编辑能力存在显著不足。 3. MMAE设计了6级任务复杂度,从基础修改到多跳推理和多轮编辑,以及8种操作类型覆盖局部和全局粒度。