Claude 开发者团队分享了两种多智能体模式:Advisor(顾问)模式和 Orchestrator(编排者)模式,通过组合 Sonnet 5 和 Fable 5 实现接近顶级模型性能并大幅降低成本。Advisor 模式中 Sonnet 5 作为执行者,低频率调用 Fable 5 获取建议,在 SWE-bench Pro 上达到 Fable 5 约 92% 的性能,成本仅约 63%。Orchestrator 模式中 Fable 5 作为编排者规划并委派任务给多个 Sonnet 5 worker,在 BrowseComp 上达到 Fable 5 约 96% 的性能,成本仅约 46%。开发者可根据任务类型选择模式以优化性价比。 核心观点: 1. Advisor 模式在 SWE-bench Pro 上以 $1.40 成本实现 ~84% 准确率,相比纯 Fable 5 的 $2.25 成本节省约 37%。 2. Orchestrator 模式在 BrowseComp 上以 $18.53 成本实现 86.8% 准确率,相比纯 Fable 5 的 $40.56 成本节省约 54%。 3. Orchestrator 模式相比纯 Sonnet 5 准确率提升约 9 个百分点,成本仅增加约 $2.5。
Lilian Weng 系统梳理了通过 Harness Engineering 推动 AI 递归式自我改进(RSI)的方法。她认为 RSI 短期内不会从模型直接重写权重开始,而是从模型改进其部署系统(harness)开始。文章归纳了 Workflow Automation、File System as Persistent Memory、Sub-agent & Backend Jobs 三类基础设计模式,并深入探讨了 Context Engineering、Workflow Design、Self-Improving Harness、Evolutionary Search 等优化路径。最后指出了评估器弱、记忆退化、多样性坍缩等七大瓶颈。对开发者而言,这提供了从系统设计角度实现 AI 自我改进的实用框架。 核心观点: 1. STOP 递归改进在 GPT-4 上有效,但在 GPT-3.5/Mixtral 上反而退化,说明基座模型强度是关键前提。 2. Self-Harness 通过 weakness mining、bounded edits 和 held-in/held-out 双重回归测试,能学到 model-specific 指令。 3. Darwin Gödel Machine 在 SWE-bench Verified 上从 20% 提升到 50%,但仅在评估易量化的领域有效。
Fireworks AI 在权重开放当日即上线 GLM 5.2 模型,支持 100 万 token 上下文,定位为编码优先的前沿模型。该模型已在 SWE-bench、Terminal-Bench、GPQA 和 AIME 等基准上获得独立验证,为开发者提供可立即使用的编码场景推理能力。 核心观点: 1. GLM 5.2 支持 100 万 token 上下文窗口,面向编码优先场景。 2. 模型在 SWE-bench、Terminal-Bench、GPQA 和 AIME 基准上获得独立验证。 3. Fireworks AI 在权重开放当日即部署该模型,实现零日上线。