腾讯混元发布UniRL,一个跨模态统一强化学习训练框架,支持文本、图像、视频等多种模态,并附带FlowDPPO和DRPO两种原创算法
多源视角
Re 1、Most RL stacks are built for one modality. UniRL applies a single post-training loop — generate → score → advantage → update → sync — across model families. Model and algorith…
查看这条来源🚀Introducing UniRL, an RL infra for unified multimodal models. Together with two new RL algorithms: DRPO and Flow-DPPO.<br><br>One RL loop across diffusion/flow matching models, L…
查看这条来源AI 摘要
腾讯混元发布UniRL,一个跨模态统一强化学习训练框架,支持文本、图像、视频等多种模态。该框架通过单一后训练循环(生成→评分→优势→更新→同步)覆盖不同模型家族,将模型与算法作为独立轴,实现模型×算法的组合覆盖。UniRL内置可插拔的rollout引擎(train-side/SGLang/vLLM-Omni)、FSDP2分片和三种部署模式。同时附带两种原创算法:用于流/扩散模型的FlowDPPO和用于LLM的DRPO。对开发者而言,UniRL提供了一个统一的多模态RL训练基础设施,降低了跨模态RL训练的实现成本。 核心观点: 1. UniRL将模型与算法作为独立轴,实现模型×算法的组合覆盖,而非固定配方菜单。 2. FlowDPPO是针对流/扩散模型的策略优化算法,使用基于精确散度的信任域掩码。 3. DRPO是LLM强化学习算法,采用平滑的优势加权二次正则化器。
推荐理由高信息密度,值得细读
原文
无法获取正文,可打开下方原始链接查看。
讨论
暂无评论。