Cursor 通过自研基准 CursorBench 和实际工程测试,验证了 Claude Fable 5 在复杂模糊编程任务中的全局推理能力,显著提升开发效率补录
Cursor 通过自研基准 CursorBench 和实际工程测试,验证了 Claude Fable 5 在复杂模糊编程任务中的全局推理能力,显著提升开发效率。
Cursor团队发现公共基准与开发者实际体验脱节,自研CursorBench。Claude Fable 5在CursorBench上取得72.9%高分,并在实际工程测试中展现全局推理能力,能理解模糊任务意图,无需反复引导。这显著提升开发效率,降低复杂任务门槛,使团队能处理之前搁置的项目,并改变协作方式。 核心观点: 1. Claude Fable 5在CursorBench上达到72.9%准确率(Max effort),创下新高。 2. 在登月模拟实验中,Fable 5通过全局推理成功登月,而Opus仅局部推理失败。 3. Schmidt团队将Fable 5与轻量模型结合,用于最难问题,优化时间成本。
推荐理由常规版本更新,跟进即可