# 腾讯混元发布UniRL，一个跨模态统一强化学习训练框架，支持文本、图像、视频等多种模态，并附带FlowDPPO和DRPO两种原创算法

- 来源：Tencent Hunyuan
- 发布时间：2026-06-09 20:03
- AIWatch 分数：73
- AIWatch 标记：当日精选
- AIWatch 链接：https://aiwatch.icu/events/evt_01kv4j2dp8vddmbhe2mm80k1xt
- 原文链接：https://x.com/TencentHunyuan/status/2064317469968503281

## 精选理由

高信息密度，值得细读

## AI 摘要

腾讯混元发布UniRL，一个跨模态统一强化学习训练框架，支持文本、图像、视频等多种模态。该框架通过单一后训练循环（生成→评分→优势→更新→同步）覆盖不同模型家族，将模型与算法作为独立轴，实现模型×算法的组合覆盖。UniRL内置可插拔的rollout引擎（train-side/SGLang/vLLM-Omni）、FSDP2分片和三种部署模式。同时附带两种原创算法：用于流/扩散模型的FlowDPPO和用于LLM的DRPO。对开发者而言，UniRL提供了一个统一的多模态RL训练基础设施，降低了跨模态RL训练的实现成本。
核心观点：
1. UniRL将模型与算法作为独立轴，实现模型×算法的组合覆盖，而非固定配方菜单。
2. FlowDPPO是针对流/扩散模型的策略优化算法，使用基于精确散度的信任域掩码。
3. DRPO是LLM强化学习算法，采用平滑的优势加权二次正则化器。

## 正文

腾讯混元发布UniRL，一个跨模态统一强化学习训练框架，支持文本、图像、视频等多种模态。该框架通过单一后训练循环（生成→评分→优势→更新→同步）覆盖不同模型家族，将模型与算法作为独立轴，实现模型×算法的组合覆盖。UniRL内置可插拔的rollout引擎（train-side/SGLang/vLLM-Omni）、FSDP2分片和三种部署模式。同时附带两种原创算法：用于流/扩散模型的FlowDPPO和用于LLM的DRPO。对开发者而言，UniRL提供了一个统一的多模态RL训练基础设施，降低了跨模态RL训练的实现成本。
核心观点：
1. UniRL将模型与算法作为独立轴，实现模型×算法的组合覆盖，而非固定配方菜单。
2. FlowDPPO是针对流/扩散模型的策略优化算法，使用基于精确散度的信任域掩码。
3. DRPO是LLM强化学习算法，采用平滑的优势加权二次正则化器。
