# Artificial Analysis 发布 AA-Briefcase 基准，用于评估模型在长期知识工作项目中的能力，Claude Fable 5 以 1587 Elo 领先

- 来源：智谱AI
- 发布时间：2026-06-19 07:01
- AIWatch 分数：72
- AIWatch 标记：当日精选
- AIWatch 链接：https://aiwatch.icu/events/evt_01kwej2j640w4mwy1t7q2x72an
- 原文链接：https://x.com/Zai_org/status/2067775548332355643

## 精选理由

高信息密度，值得细读

## AI 摘要

Artificial Analysis 发布 AA-Briefcase 基准测试，用于评估 AI 模型在长期知识工作项目中的能力。该基准由行业专家构建，模拟数周的真实项目，包含数千个输入文件和多个关联任务。Claude Fable 5 以 1587 Elo 领先，但每任务平均成本 31 美元；开源模型 GLM-5.2 以 1266 Elo 和 2.40 美元成本提供了最佳性价比。测试显示，即使顶级模型也仅在 3% 的任务中满足所有标准，真实世界的复杂性仍是挑战。
核心观点：
1. AA-Briefcase 包含 25,000+ Slack 消息和 3,500+ 邮件等碎片化、矛盾的真实上下文，测试模型处理模糊信息的能力。
2. Claude Fable 5 在 91 个任务中仅 3% 满足所有评分标准，31 个任务无模型得分超 50%，表明长期知识工作难度极高。
3. GLM-5.2 (max) 以 1266 Elo 和 2.40 美元成本，成为最强性价比选项，仅比 Claude Opus 4.8 低约 90 Elo 但成本不足其 25%。

## 正文

Artificial Analysis 发布 AA-Briefcase 基准测试，用于评估 AI 模型在长期知识工作项目中的能力。该基准由行业专家构建，模拟数周的真实项目，包含数千个输入文件和多个关联任务。Claude Fable 5 以 1587 Elo 领先，但每任务平均成本 31 美元；开源模型 GLM-5.2 以 1266 Elo 和 2.40 美元成本提供了最佳性价比。测试显示，即使顶级模型也仅在 3% 的任务中满足所有标准，真实世界的复杂性仍是挑战。
核心观点：
1. AA-Briefcase 包含 25,000+ Slack 消息和 3,500+ 邮件等碎片化、矛盾的真实上下文，测试模型处理模糊信息的能力。
2. Claude Fable 5 在 91 个任务中仅 3% 满足所有评分标准，31 个任务无模型得分超 50%，表明长期知识工作难度极高。
3. GLM-5.2 (max) 以 1266 Elo 和 2.40 美元成本，成为最强性价比选项，仅比 Claude Opus 4.8 低约 90 Elo 但成本不足其 25%。
