Fireworks AI 针对 MiniMax M3 模型在 NVIDIA Blackwell 架构上设计了一种 KV-stationary 稀疏注意力内核。该内核通过将每个选定的 KV 块仅读取一次,解决了稀疏注意力中数据依赖块选择破坏内存访问速度的问题,在 B200 GPU 上实现了约 980 TFLOP/s 的吞吐量。这一优化对需要长上下文稀疏注意力的开发者具有重要参考价值。 核心观点: 1. Fireworks AI 为 MiniMax M3 模型在 Blackwell 上设计的稀疏注意力内核采用 KV-stationary 设计,每个选定块仅读取一次。 2. 该内核在 B200 GPU 上达到约 980 TFLOP/s 的吞吐量。
智谱AI的旗舰模型GLM-5.2已在OpenRouter平台上线。该模型专为长时程编码智能体任务设计,支持高达1M token的上下文窗口,能够在长且复杂的编码智能体工作中保持可靠性。这对开发者意味着可以处理更长的代码上下文和更复杂的智能体工作流。 核心观点: 1. GLM-5.2支持1M token上下文窗口,专为长时程编码智能体任务优化。
Zai_org 发布了其旗舰模型 GLM-5.2,该模型已在 Nebius Token Factory 平台上线并获得 Day 0 支持。新模型在编码能力、智能体能力和长上下文执行方面有显著提升,旨在满足高要求的工程工作流需求。 核心观点: 1. GLM-5.2 在 Nebius Token Factory 获得 Day 0 支持,即发布当天即可使用。 2. 新模型在编码、智能体能力和长上下文执行方面有提升。
MiniMax 发布开放权重模型 MiniMax M3。该模型总参数量约 428B、激活参数量约 23B,支持 1M-token 上下文窗口与原生多模态理解,并具备前沿编码与 Agent 能力。模型权重已上架 Hugging Face,同时发布了 MiniMax Sparse Attention 论文。开发者可直接下载部署,在超长上下文、多模态及 Agent 场景中进行应用开发与评测。 核心观点: 1. MiniMax M3 总参数量约 428B,激活参数量约 23B,以开放权重形式发布。 2. 模型支持 1M-token 上下文窗口,具备原生多模态理解及前沿编码与 Agent 能力。 3. 权重已上架 Hugging Face,并配套发布 MiniMax Sparse Attention 技术论文。