Cursor团队发现公共基准与开发者实际体验脱节,自研CursorBench。Claude Fable 5在CursorBench上取得72.9%高分,并在实际工程测试中展现全局推理能力,能理解模糊任务意图,无需反复引导。这显著提升开发效率,降低复杂任务门槛,使团队能处理之前搁置的项目,并改变协作方式。 核心观点: 1. Claude Fable 5在CursorBench上达到72.9%准确率(Max effort),创下新高。 2. 在登月模拟实验中,Fable 5通过全局推理成功登月,而Opus仅局部推理失败。 3. Schmidt团队将Fable 5与轻量模型结合,用于最难问题,优化时间成本。
Anthropic 通过将 Claude 表达的数千种价值观压缩为四个轴(Deference vs. Caution、Warmth vs. Rigor、Depth vs. Brevity、Candor vs. Execution),分析了 309,815 个对话,发现模型版本和语言显著影响价值观倾向。例如,Opus 4.7 更偏向 Caution 和 Depth,而 Opus 4.6 更偏向 Deference 和 Brevity;阿拉伯语更偏向 Warmth,英语更偏向 Rigor。该方法为理解训练决策和文化背景对 AI 价值观的影响提供了量化工具。 核心观点: 1. 四个轴解释了15%的价值观变异(控制任务、主题和用户表达后)。 2. Opus 4.7 偏向 Caution 和 Depth,Opus 4.6 偏向 Deference 和 Brevity。 3. 阿拉伯语和印地语更偏向 Warmth,英语和俄语更偏向 Rigor。
OpenAI 提出了一种名为 Deployment Simulation 的新方法,利用真实对话数据在模型发布前预测其行为,旨在提升 AI 模型的安全性和评估准确性。该方法通过模拟部署环境,使开发者能在模型上线前识别潜在风险,从而更有效地进行安全对齐。这一进展对 AI 安全研究和模型评估实践具有重要参考价值。
大语言模型的规划能力是从“说”到“做”的关键。腾讯混元联合中国人民大学高瓴人工智能学院开源 PlanningBench 框架,提供 30 余项真实任务与自动验证能力,支持对 LLM 规划能力的可扩展评估与训练。该框架为开发者和研究者提供了系统化的基准测试环境,有助于更准确地衡量和提升大语言模型的实际规划与执行水平。 核心观点: 1. PlanningBench 涵盖 30 余项真实世界规划任务,用于评估大语言模型在实际场景中的规划表现。 2. 框架内置自动化验证机制,并同时支持对 LLM 规划能力的评估与训练。