Fireworks AI 针对 MiniMax M3 模型在 NVIDIA Blackwell 架构上设计了一种 KV-stationary 稀疏注意力内核。该内核通过将每个选定的 KV 块仅读取一次,解决了稀疏注意力中数据依赖块选择破坏内存访问速度的问题,在 B200 GPU 上实现了约 980 TFLOP/s 的吞吐量。这一优化对需要长上下文稀疏注意力的开发者具有重要参考价值。 核心观点: 1. Fireworks AI 为 MiniMax M3 模型在 Blackwell 上设计的稀疏注意力内核采用 KV-stationary 设计,每个选定块仅读取一次。 2. 该内核在 B200 GPU 上达到约 980 TFLOP/s 的吞吐量。
MiniMax 发布开放权重模型 MiniMax M3。该模型总参数量约 428B、激活参数量约 23B,支持 1M-token 上下文窗口与原生多模态理解,并具备前沿编码与 Agent 能力。模型权重已上架 Hugging Face,同时发布了 MiniMax Sparse Attention 论文。开发者可直接下载部署,在超长上下文、多模态及 Agent 场景中进行应用开发与评测。 核心观点: 1. MiniMax M3 总参数量约 428B,激活参数量约 23B,以开放权重形式发布。 2. 模型支持 1M-token 上下文窗口,具备原生多模态理解及前沿编码与 Agent 能力。 3. 权重已上架 Hugging Face,并配套发布 MiniMax Sparse Attention 技术论文。
MiniMax 宣布开源高性能 MSA kernel 库,并预告 M3 模型权重将于本周五发布。MSA 库为稀疏注意力提供底层高性能实现,开发者可通过 GitHub 获取代码与论文。此举降低了稀疏注意力优化门槛,同时 M3 开放权重将让研究者能够本地部署该模型进行后续研究与开发。