智谱AIZ.ai当日精选
Artificial Analysis 发布 AA-Briefcase 基准,用于评估模型在长期知识工作项目中的能力,Claude Fable 5 以 1587 Elo 领先
AI 摘要
Artificial Analysis 发布 AA-Briefcase 基准测试,用于评估 AI 模型在长期知识工作项目中的能力。该基准由行业专家构建,模拟数周的真实项目,包含数千个输入文件和多个关联任务。Claude Fable 5 以 1587 Elo 领先,但每任务平均成本 31 美元;开源模型 GLM-5.2 以 1266 Elo 和 2.40 美元成本提供了最佳性价比。测试显示,即使顶级模型也仅在 3% 的任务中满足所有标准,真实世界的复杂性仍是挑战。 核心观点: 1. AA-Briefcase 包含 25,000+ Slack 消息和 3,500+ 邮件等碎片化、矛盾的真实上下文,测试模型处理模糊信息的能力。 2. Claude Fable 5 在 91 个任务中仅 3% 满足所有评分标准,31 个任务无模型得分超 50%,表明长期知识工作难度极高。 3. GLM-5.2 (max) 以 1266 Elo 和 2.40 美元成本,成为最强性价比选项,仅比 Claude Opus 4.8 低约 90 Elo 但成本不足其 25%。
推荐理由高信息密度,值得细读
原文
无法获取正文,可打开下方原始链接查看。
AgentBenchmark知识工作长期任务成本分析开源模型Claude Fable 5GLM-5.272/100
讨论
暂无评论。