Anthropic 发布 Claude Sonnet 5,定位为 Agent 能力接近旗舰 Opus 4.8 但价格仅为其 40% 的模型。在 Agent 编程基准上 Sonnet 5 得分 63.2%,高于前代 Sonnet 4.6 的 58.1%,低于 Opus 4.8 的 69.2%;知识工作基准甚至略超 Opus 4.8。模型更换了新分词器,同样文本可能消耗 1.0-1.35 倍 Token,但推广期定价已对冲此涨幅。对开发者而言,Sonnet 5 提供了更优的性价比,但需注意推广期结束后实际花费涨幅可能高于标价涨幅。 核心观点: 1. Sonnet 5 在 Agent 编程基准得分 63.2%,Sonnet 4.6 为 58.1%,Opus 4.8 为 69.2%。 2. 新分词器导致同样文本消耗 1.0-1.35 倍 Token,推广期定价已对冲此涨幅。 3. API 推广价(至 8 月 31 日)为输入 $2/百万 Token、输出 $10/百万 Token,之后涨至 $3 和 $15。
OpenAI 于6月26日发布 GPT-5.6 系列模型,包含旗舰级 Sol、日常级 Terra 和经济级 Luna。因美国政府要求,目前仅向约20家经审批的合作伙伴开放预览。Sol 新增 max 深度推理与 ultra 多子 Agent 并行模式,在 Terminal-Bench 2.1 上 Sol Ultra 得分 91.9%。Terra 性能接近上一代 GPT-5.5 但价格减半,Luna 主打低成本高吞吐。7月将上线 Cerebras 硬件加速版本,推理速度达每秒750 token。对开发者而言,Terra 的高性价比和 Sol 的 ultra 模式值得关注。 核心观点: 1. Sol Ultra 在 Terminal-Bench 2.1 上得分 91.9%,高于 Claude Mythos 5 的 88% 和 Gemini 3.1 Pro Preview 的 70.7%。 2. Sol 在 ExploitBench 上用约三分之一的 token 达到 Mythos Preview 的网络安全水平。 3. Sol 的 ultra 模式可调用多个子 Agent 并行处理复杂任务,无需开发者自行搭建 Agent 编排框架。
DeepInfra 上线了智谱 AI 的 GLM-5.2 模型。该模型采用 744B/40B MoE 架构,MIT 许可,支持 1M 上下文窗口。在 FrontierSWE、PostTrainBench 和 SWE-Marathon 基准测试中,GLM-5.2 表现领先于其他开源模型。DeepInfra 提供该模型的 API 服务,定价为每百万 token 输入 $1.40、输出 $4.40、缓存 $0.25。开发者可通过 DeepInfra 平台直接调用该模型。 核心观点: 1. GLM-5.2 采用 744B/40B MoE 架构,支持 1M 上下文窗口,MIT 许可。 2. 在 FrontierSWE、PostTrainBench、SWE-Marathon 三项基准中,GLM-5.2 为表现最佳的开源模型。 3. DeepInfra 定价:输入 $1.40/1M tokens,输出 $4.40/1M tokens,缓存 $0.25/1M tokens。