Google DeepMind 发布了 DiffusionGemma 模型,采用扩散方法进行文本生成,相比传统自回归模型实现了4倍的速度提升。这一创新为高效推理提供了新思路,可能对需要快速响应的应用场景产生重要影响。开发者可关注其在实时对话、内容生成等领域的潜力。 核心观点: 1. DiffusionGemma 通过扩散方法实现文本生成速度提升4倍。
腾讯混元发布UniRL,一个跨模态统一强化学习训练框架,支持文本、图像、视频等多种模态。该框架通过单一后训练循环(生成→评分→优势→更新→同步)覆盖不同模型家族,将模型与算法作为独立轴,实现模型×算法的组合覆盖。UniRL内置可插拔的rollout引擎(train-side/SGLang/vLLM-Omni)、FSDP2分片和三种部署模式。同时附带两种原创算法:用于流/扩散模型的FlowDPPO和用于LLM的DRPO。对开发者而言,UniRL提供了一个统一的多模态RL训练基础设施,降低了跨模态RL训练的实现成本。 核心观点: 1. UniRL将模型与算法作为独立轴,实现模型×算法的组合覆盖,而非固定配方菜单。 2. FlowDPPO是针对流/扩散模型的策略优化算法,使用基于精确散度的信任域掩码。 3. DRPO是LLM强化学习算法,采用平滑的优势加权二次正则化器。