MiniMax 发布开放权重模型 MiniMax M3。该模型总参数量约 428B、激活参数量约 23B,支持 1M-token 上下文窗口与原生多模态理解,并具备前沿编码与 Agent 能力。模型权重已上架 Hugging Face,同时发布了 MiniMax Sparse Attention 论文。开发者可直接下载部署,在超长上下文、多模态及 Agent 场景中进行应用开发与评测。 核心观点: 1. MiniMax M3 总参数量约 428B,激活参数量约 23B,以开放权重形式发布。 2. 模型支持 1M-token 上下文窗口,具备原生多模态理解及前沿编码与 Agent 能力。 3. 权重已上架 Hugging Face,并配套发布 MiniMax Sparse Attention 技术论文。
Google 本周密集发布多款 AI 产品与技术更新:推出 Gemini 3.5 Live Translate 实时语音翻译音频模型;升级 NotebookLM,新增聊天智能体能力、增强推理及多种输出格式;Project Genie 向全球 Google AI Ultra 5x 订阅者开放;Gemini App 的 Notebooks 扩展至欧洲经济区等地;并开源实验性文本扩散模型 DiffusionGemma。对开发者而言,DiffusionGemma 提供了探索非自回归文本生成的新路径,NotebookLM 的升级则强化了 AI 智能体在知识工作流中的实用价值。 核心观点: 1. NotebookLM 升级新增聊天智能体能力、更高级推理及新输出格式套件。 2. Project Genie 现面向 Google AI Ultra 5x 订阅者全球推出。 3. DiffusionGemma 是实验性开放模型,采用文本扩散方法实现极快的文本生成。
Google DeepMind 发布了 Gemma 4 12B 模型,这是一款统一的无编码器多模态模型,旨在为开发者提供轻量级的多模态能力。该模型无需传统编码器即可处理多种输入模态,降低了部署复杂度。对开发者而言,这意味着可以在资源受限的环境中集成多模态功能,拓展了轻量级 AI 应用的可能性。 核心观点: 1. Gemma 4 12B 采用无编码器架构,简化了多模态模型的部署流程。 2. 该模型为 12B 参数规模的轻量级设计,适合资源受限的开发场景。
腾讯混元联合上海交通大学、新加坡南洋理工大学等多所高校发布MMAE,这是首个大规模多任务音频编辑基准。MMAE要求AI理解现有音频并根据自然语言指令精确修改,而非简单生成。基准包含2000个真实场景样本、17741个细粒度评估项,覆盖7种模态、6级任务复杂度、8种操作类型。当前模型精确匹配率(EMR)低于5%,揭示了可靠音频编辑能力的重大缺口,为开发者提供了明确的评测标准。 核心观点: 1. MMAE包含2000个高保真样本和17741个细粒度评估项,覆盖声音、音乐、语音及其混合共7种模态。 2. 当前模型在MMAE上的精确匹配率(EMR)低于5%,表明音频编辑能力存在显著不足。 3. MMAE设计了6级任务复杂度,从基础修改到多跳推理和多轮编辑,以及8种操作类型覆盖局部和全局粒度。
Google 本周密集发布多款 AI 产品。Gemma 4 12B 作为统一的 encoder-free 多模态模型,支持笔记本端完全离线运行,并通过 Quantization-Aware Training (QAT) 降低内存占用;Nano Banana 2 与 Nano Banana Pro 企业智能体平台正式商用;Co-Scientist 科研多智能体系统可生成并优化科学假设;Magenta RealTime 2 开放权重实时音乐模型支持 MIDI 与手势交互。对开发者而言,端侧部署与企业智能体工具链得到显著增强。 核心观点: 1. Gemma 4 12B 采用 encoder-free 架构,支持笔记本完全离线运行多模态任务。 2. Gemma 4 及其 drafters 经 Quantization-Aware Training (QAT) 优化,可降低内存需求并最大化端侧性能。 3. Magenta RealTime 2 为开放权重实时音乐模型,支持通过 MIDI 键盘、文本提示和手势进行演奏交互。
微软AI发布MAI-Image-2.5图像生成与编辑模型,具备强照片级真实感、精确编辑和细节处理能力。该模型宣传图由自身生成,用户可通过Playground或OpenRouter体验。