Artificial Analysis 发布 AA-Briefcase 基准测试,用于评估 AI 模型在长期知识工作项目中的能力。该基准由行业专家构建,模拟数周的真实项目,包含数千个输入文件和多个关联任务。Claude Fable 5 以 1587 Elo 领先,但每任务平均成本 31 美元;开源模型 GLM-5.2 以 1266 Elo 和 2.40 美元成本提供了最佳性价比。测试显示,即使顶级模型也仅在 3% 的任务中满足所有标准,真实世界的复杂性仍是挑战。 核心观点: 1. AA-Briefcase 包含 25,000+ Slack 消息和 3,500+ 邮件等碎片化、矛盾的真实上下文,测试模型处理模糊信息的能力。 2. Claude Fable 5 在 91 个任务中仅 3% 满足所有评分标准,31 个任务无模型得分超 50%,表明长期知识工作难度极高。 3. GLM-5.2 (max) 以 1266 Elo 和 2.40 美元成本,成为最强性价比选项,仅比 Claude Opus 4.8 低约 90 Elo 但成本不足其 25%。
Artificial Analysis 发布 AA-Briefcase 基准测试,用于评估模型在长期、多步骤知识工作项目中的能力。测试场景由行业专家设计,包含数千输入文件(如 Slack 消息、邮件)。Claude Fable 5 以 1587 Elo 领先,但每任务成本约 $31;开源模型 GLM-5.2 以约 $2.40 成本取得 1266 Elo,性价比突出。所有模型在真实复杂任务中表现仍有限,顶级模型仅 3% 任务满足全部标准。 核心观点: 1. Claude Fable 5 在 AA-Briefcase 上以 1587 Elo 领先,未使用 Opus 4.8 回退。 2. GLM-5.2 (max) 以 $2.40 成本取得 1266 Elo,性价比优于 Claude Opus 4.8。 3. 所有模型在 91 个任务中仅 3% 满足全部 rubric 标准,31 个任务无模型得分超 50%。
vLLM v0.23.0 发布,提供对智谱 GLM-5.2 模型的 Day-0 支持。GLM-5.2 是一款开放权重模型,拥有 1M token 上下文窗口,专为长周期编码智能体设计,可承载从需求到部署的完整开发工作流。开发者现可直接在 vLLM 上运行该模型,用于大规模代码实现、自动化研究和性能优化等场景。 核心观点: 1. GLM-5.2 提供两种推理力度:GLM-5.2 (max) 和 GLM-5.2 (high)。 2. 模型支持客户端和移动端工程,包含设备端调试循环。
Z.ai 发布 GLM-5.2 旗舰模型,支持 1M token 上下文窗口,在编码和长程智能体任务上显著提升。Terminal-Bench 2.1 得分从 62.0 升至 81.0;IndexShare 技术使 1M 上下文下每 token FLOPs 降低 2.9 倍,改进的 MTP 将投机解码接受率提升 20%。模型提供 High/Max 两种推理努力级别,已获 SGLang 首日支持。 核心观点: 1. GLM-5.2 在 Terminal-Bench 2.1 上得分 81.0,相比 GLM-5.1 的 62.0 提升显著。 2. IndexShare 技术使 1M token 上下文下每 token FLOPs 降低 2.9 倍。 3. 改进的 MTP 将投机解码接受率提升最多 20%。
GLM-5.2 发布,性能对标 Opus 4.8,支持 1M 上下文窗口。其采用新的 IS 注意力机制,每 4 个稀疏层复用 1 个索引器,在 1M 上下文下每 token FLOPs 降低 2.9 倍;改进了 MTP 层用于推测解码,并支持灵活的思考努力级别。模型发布首日即在 transformers、vLLM、SGLang 中可用,采用 MIT 许可证。对开发者而言,可立即在主流推理框架中使用,并受益于长上下文和推理效率提升。 核心观点: 1. IS 注意力机制每 4 个稀疏层复用 1 个索引器,在 1M 上下文下每 token FLOPs 降低 2.9 倍。 2. GLM-5.2 发布首日即支持 transformers、vLLM、SGLang,采用 MIT 许可证。