Cursor团队在AI Engineer演讲中提出递归模型改进框架,通过外循环(用户反馈、A/B测试)和内循环(自动化训练、RL环境)系统化加速模型迭代。他们构建了大规模agent舰队自动化研究流程,并展示了模型辅助训练下一代模型的递归机制。该团队还与SpaceXAI联合训练Grok 4.5,利用Cursor真实交互数据进行强化学习。这启示开发者可通过构建闭环反馈和自动化研究基础设施来提升模型迭代效率。 核心观点: 1. Cursor 通过外循环(用户反馈)和内循环(自动化训练)双循环系统,实现模型快速迭代。 2. Composer 2.5 因更多 RL 环境、激进任务难度和新训练方法成为 Cursor 最受欢迎模型。 3. 更强主模型可蒸馏出更好辅助模型(judge、reward model),形成递归自我改进正反馈。
Anthropic 联合创始人 Ben Mann 及团队回顾了 Claude Code 从 2022 年 VS Code 插件到命令行工具的研发历程。早期模型在智能体编程上表现糟糕,团队通过强化学习训练逐步突破,解决了 bash 工具、代码执行环境等关键问题。2024 年 Labs 团队成立后,Boris Cherny 将内部工具 clide 重构为 Claude CLI,最终演变为 Claude Code。该历程揭示了强化学习训练和智能体架构在编程自动化中的核心作用。 核心观点: 1. Claude Code 的智能体能力源于 2022 年搭建的强化学习代码库,从简单函数编写逐步升级到自主软件工程。 2. 早期 clide 工具已支持并发启动 100 个 Claude Haiku 处理超上下文窗口的代码库。 3. Boris Cherny 在两天内用 API 原型出 Claude CLI,核心元素已包含截图读取 Apple Music 等自主操作。
腾讯混元发布UniRL,一个跨模态统一强化学习训练框架,支持文本、图像、视频等多种模态。该框架通过单一后训练循环(生成→评分→优势→更新→同步)覆盖不同模型家族,将模型与算法作为独立轴,实现模型×算法的组合覆盖。UniRL内置可插拔的rollout引擎(train-side/SGLang/vLLM-Omni)、FSDP2分片和三种部署模式。同时附带两种原创算法:用于流/扩散模型的FlowDPPO和用于LLM的DRPO。对开发者而言,UniRL提供了一个统一的多模态RL训练基础设施,降低了跨模态RL训练的实现成本。 核心观点: 1. UniRL将模型与算法作为独立轴,实现模型×算法的组合覆盖,而非固定配方菜单。 2. FlowDPPO是针对流/扩散模型的策略优化算法,使用基于精确散度的信任域掩码。 3. DRPO是LLM强化学习算法,采用平滑的优势加权二次正则化器。