智谱AIZ.ai当日精选
Artificial Analysis 发布 AA-Briefcase 基准测试,评估模型在长期知识工作项目中的能力,Claude Fable 5 以 1587 Elo 领先
AI 摘要
Artificial Analysis 发布 AA-Briefcase 基准测试,用于评估模型在长期、多步骤知识工作项目中的能力。测试场景由行业专家设计,包含数千输入文件(如 Slack 消息、邮件)。Claude Fable 5 以 1587 Elo 领先,但每任务成本约 $31;开源模型 GLM-5.2 以约 $2.40 成本取得 1266 Elo,性价比突出。所有模型在真实复杂任务中表现仍有限,顶级模型仅 3% 任务满足全部标准。 核心观点: 1. Claude Fable 5 在 AA-Briefcase 上以 1587 Elo 领先,未使用 Opus 4.8 回退。 2. GLM-5.2 (max) 以 $2.40 成本取得 1266 Elo,性价比优于 Claude Opus 4.8。 3. 所有模型在 91 个任务中仅 3% 满足全部 rubric 标准,31 个任务无模型得分超 50%。
推荐理由高信息密度,值得细读
原文
无法获取正文,可打开下方原始链接查看。
基准测试知识工作长期任务成本分析Claude Fable 5GLM-5.2开源模型73/100
讨论
暂无评论。