Google 在 Flash 系列基础上发布 Gemini 3.7 Flash,专为编码和智能体任务优化。相比 3.6 Flash,在代码生成、Web 开发、知识工作等基准测试上显著提升,如 FrontierCode 1.1 从 34.4% 升至 43.6%,WebDev Arena Elo 从 1538 升至 1588。同时推出半价优惠,输入 $0.75/1M tokens,输出 $3.75/1M tokens,使开发者能更经济地扩展生产级智能体。模型已集成到 Gemini Spark 等产品中。 核心观点: 1. Gemini 3.7 Flash 在 FrontierCode 1.1 Main 上达 43.6%,较 3.6 Flash 的 34.4% 提升 9.2 个百分点。 2. 在 WebDev Arena 中 Elo 得分从 1538 升至 1588,生成更功能完整的 Web 应用。 3. AutomationBench 得分从 17.0% 升至 30.4%,企业工作流自动化能力显著增强。
Artificial Analysis 发布 AA-Briefcase 基准测试,用于评估 AI 模型在长期知识工作项目中的能力。该基准由行业专家构建,模拟数周的真实项目,包含数千个输入文件和多个关联任务。Claude Fable 5 以 1587 Elo 领先,但每任务平均成本 31 美元;开源模型 GLM-5.2 以 1266 Elo 和 2.40 美元成本提供了最佳性价比。测试显示,即使顶级模型也仅在 3% 的任务中满足所有标准,真实世界的复杂性仍是挑战。 核心观点: 1. AA-Briefcase 包含 25,000+ Slack 消息和 3,500+ 邮件等碎片化、矛盾的真实上下文,测试模型处理模糊信息的能力。 2. Claude Fable 5 在 91 个任务中仅 3% 满足所有评分标准,31 个任务无模型得分超 50%,表明长期知识工作难度极高。 3. GLM-5.2 (max) 以 1266 Elo 和 2.40 美元成本,成为最强性价比选项,仅比 Claude Opus 4.8 低约 90 Elo 但成本不足其 25%。
Artificial Analysis 发布 AA-Briefcase 基准测试,用于评估模型在长期、多步骤知识工作项目中的能力。测试场景由行业专家设计,包含数千输入文件(如 Slack 消息、邮件)。Claude Fable 5 以 1587 Elo 领先,但每任务成本约 $31;开源模型 GLM-5.2 以约 $2.40 成本取得 1266 Elo,性价比突出。所有模型在真实复杂任务中表现仍有限,顶级模型仅 3% 任务满足全部标准。 核心观点: 1. Claude Fable 5 在 AA-Briefcase 上以 1587 Elo 领先,未使用 Opus 4.8 回退。 2. GLM-5.2 (max) 以 $2.40 成本取得 1266 Elo,性价比优于 Claude Opus 4.8。 3. 所有模型在 91 个任务中仅 3% 满足全部 rubric 标准,31 个任务无模型得分超 50%。