# Xiaomi MiMo 开源 1T 模型，通过 FP4 量化与 DFlash 推测解码，在单节点 8-GPU 上实现 1000+ tps 推理

- 来源：Xiaomi MiMo
- 发布时间：2026-06-08 22:37
- AIWatch 分数：69
- AIWatch 标记：当日精选
- AIWatch 链接：https://aiwatch.icu/events/evt_01ktwsnzvfapm0n50g3ph00sk9
- 原文链接：https://x.com/XiaomiMiMo/status/2064202686820659346

## 精选理由

高信息密度，值得细读

## AI 摘要

大模型高吞吐推理长期依赖专用加速器。Xiaomi MiMo 联合 TileRT 团队开源 MiMo-V2.5-Pro-FP4-DFlash 1T 模型，通过 FP4 量化降低显存占用与带宽压力，并引入 DFlash 块掩码并行推测解码提升验证效率；TileRT 编译器与 kernel 针对上述技术深度定制，最终在标准 8-GPU 单节点上实现 1000+ tps。该方案仅依赖通用 GPU，为开发者提供了可复现的大规模模型高效推理路径。
核心观点：
1. FP4量化降低模型footprint与memory traffic，DFlash块掩码并行推测解码单次验证可接受更多token。
2. MiMo与TileRT团队进行模型×系统深度协同设计，TileRT编译器与kernel针对FP4和DFlash精确优化。
3. 1T参数模型在标准8-GPU单节点上突破1000 tps，无需Cerebras晶圆级或Groq SRAM ASIC等专用硬件。

## 正文

大模型高吞吐推理长期依赖专用加速器。Xiaomi MiMo 联合 TileRT 团队开源 MiMo-V2.5-Pro-FP4-DFlash 1T 模型，通过 FP4 量化降低显存占用与带宽压力，并引入 DFlash 块掩码并行推测解码提升验证效率；TileRT 编译器与 kernel 针对上述技术深度定制，最终在标准 8-GPU 单节点上实现 1000+ tps。该方案仅依赖通用 GPU，为开发者提供了可复现的大规模模型高效推理路径。
核心观点：
1. FP4量化降低模型footprint与memory traffic，DFlash块掩码并行推测解码单次验证可接受更多token。
2. MiMo与TileRT团队进行模型×系统深度协同设计，TileRT编译器与kernel针对FP4和DFlash精确优化。
3. 1T参数模型在标准8-GPU单节点上突破1000 tps，无需Cerebras晶圆级或Groq SRAM ASIC等专用硬件。
