# Artificial Analysis 发布 AA-Briefcase 基准测试，评估模型在长期知识工作项目中的能力，Claude Fable 5 以 1587 Elo 领先

- 来源：智谱AI
- 发布时间：2026-06-19 07:01
- AIWatch 分数：73
- AIWatch 标记：当日精选
- AIWatch 链接：https://aiwatch.icu/events/evt_01kvszvgjjj69q7c1bpfa4atgz
- 原文链接：https://x.com/Zai_org/status/2067775548332355643

## 精选理由

高信息密度，值得细读

## AI 摘要

Artificial Analysis 发布 AA-Briefcase 基准测试，用于评估模型在长期、多步骤知识工作项目中的能力。测试场景由行业专家设计，包含数千输入文件（如 Slack 消息、邮件）。Claude Fable 5 以 1587 Elo 领先，但每任务成本约 $31；开源模型 GLM-5.2 以约 $2.40 成本取得 1266 Elo，性价比突出。所有模型在真实复杂任务中表现仍有限，顶级模型仅 3% 任务满足全部标准。
核心观点：
1. Claude Fable 5 在 AA-Briefcase 上以 1587 Elo 领先，未使用 Opus 4.8 回退。
2. GLM-5.2 (max) 以 $2.40 成本取得 1266 Elo，性价比优于 Claude Opus 4.8。
3. 所有模型在 91 个任务中仅 3% 满足全部 rubric 标准，31 个任务无模型得分超 50%。

## 正文

Artificial Analysis 发布 AA-Briefcase 基准测试，用于评估模型在长期、多步骤知识工作项目中的能力。测试场景由行业专家设计，包含数千输入文件（如 Slack 消息、邮件）。Claude Fable 5 以 1587 Elo 领先，但每任务成本约 $31；开源模型 GLM-5.2 以约 $2.40 成本取得 1266 Elo，性价比突出。所有模型在真实复杂任务中表现仍有限，顶级模型仅 3% 任务满足全部标准。
核心观点：
1. Claude Fable 5 在 AA-Briefcase 上以 1587 Elo 领先，未使用 Opus 4.8 回退。
2. GLM-5.2 (max) 以 $2.40 成本取得 1266 Elo，性价比优于 Claude Opus 4.8。
3. 所有模型在 91 个任务中仅 3% 满足全部 rubric 标准，31 个任务无模型得分超 50%。
