Xiaomi MiMo 开源 1T 模型,通过 FP4 量化与 DFlash 推测解码,在单节点 8-GPU 上实现 1000+ tps 推理
多源视角
🚀 MiMo Code V0.1 is now live and open-source!<br><br>More than an AI coding assistant in your terminal — it's the smartest coding partner you'll ever work with.<br><br>Comes with …
查看这条来源1,000+ tokens/s is fast. 🚀<br>But what does that actually unlock?<br><video width="1920" height="1080" src="https://video.twimg.com/amplify_video/2064197219956527105/vid/avc1/1920…
查看这条来源AI 摘要
大模型高吞吐推理长期依赖专用加速器。Xiaomi MiMo 联合 TileRT 团队开源 MiMo-V2.5-Pro-FP4-DFlash 1T 模型,通过 FP4 量化降低显存占用与带宽压力,并引入 DFlash 块掩码并行推测解码提升验证效率;TileRT 编译器与 kernel 针对上述技术深度定制,最终在标准 8-GPU 单节点上实现 1000+ tps。该方案仅依赖通用 GPU,为开发者提供了可复现的大规模模型高效推理路径。 核心观点: 1. FP4量化降低模型footprint与memory traffic,DFlash块掩码并行推测解码单次验证可接受更多token。 2. MiMo与TileRT团队进行模型×系统深度协同设计,TileRT编译器与kernel针对FP4和DFlash精确优化。 3. 1T参数模型在标准8-GPU单节点上突破1000 tps,无需Cerebras晶圆级或Groq SRAM ASIC等专用硬件。
推荐理由高信息密度,值得细读
原文
无法获取正文,可打开下方原始链接查看。
讨论
暂无评论。