DeepSeek 发布了 DSpark 系统,该系统通过整合多种推测解码思路,在生产环境中实现了 1.5 到 5 倍的吞吐量提升。这一成果对开发者而言,意味着在保持模型质量的同时,可以显著降低推理延迟和成本,尤其适用于高并发场景。 核心观点: 1. DSpark 通过整合多种推测解码策略,在真实生产系统中达到 1.5x 至 5x 的吞吐量提升。
GLM-5.2 发布,性能对标 Opus 4.8,支持 1M 上下文窗口。其采用新的 IS 注意力机制,每 4 个稀疏层复用 1 个索引器,在 1M 上下文下每 token FLOPs 降低 2.9 倍;改进了 MTP 层用于推测解码,并支持灵活的思考努力级别。模型发布首日即在 transformers、vLLM、SGLang 中可用,采用 MIT 许可证。对开发者而言,可立即在主流推理框架中使用,并受益于长上下文和推理效率提升。 核心观点: 1. IS 注意力机制每 4 个稀疏层复用 1 个索引器,在 1M 上下文下每 token FLOPs 降低 2.9 倍。 2. GLM-5.2 发布首日即支持 transformers、vLLM、SGLang,采用 MIT 许可证。
大模型高吞吐推理长期依赖专用加速器。Xiaomi MiMo 联合 TileRT 团队开源 MiMo-V2.5-Pro-FP4-DFlash 1T 模型,通过 FP4 量化降低显存占用与带宽压力,并引入 DFlash 块掩码并行推测解码提升验证效率;TileRT 编译器与 kernel 针对上述技术深度定制,最终在标准 8-GPU 单节点上实现 1000+ tps。该方案仅依赖通用 GPU,为开发者提供了可复现的大规模模型高效推理路径。 核心观点: 1. FP4量化降低模型footprint与memory traffic,DFlash块掩码并行推测解码单次验证可接受更多token。 2. MiMo与TileRT团队进行模型×系统深度协同设计,TileRT编译器与kernel针对FP4和DFlash精确优化。 3. 1T参数模型在标准8-GPU单节点上突破1000 tps,无需Cerebras晶圆级或Groq SRAM ASIC等专用硬件。