千问团队开源了Qwen-MM-Plugins多模态插件集,以MCP形式将视觉、视频、音频、3D建模等能力注入智能体框架,使纯文本智能体获得多模态能力。该项目采用Skill+MCP双层解耦,提供七大能力模块,包括视觉基础、长视频记忆、音视频理解、生成剪辑、3D建模、CAD和讲题视频生成,降低了多模态智能体的开发门槛。 核心观点: 1. 项目采用Skill+MCP双层解耦,Skill是模型侧提示词资产,MCP server是工具本体,进程隔离依赖隔离。 2. 长视频记忆模块支持2小时级超长视频问答,首次提问自动构建层次化图记忆与语义检索。 3. 提供七大能力模块,覆盖视觉基础、音视频理解、生成剪辑、3D建模、CAD等,可灵活组合。
Black Forest Labs 发布 FLUX 3 Video 多模态模型,统一视频、音频、图像生成及动作预测,现已在 Replicate 上线。支持生成20秒1080p视频,具备原生音频、文本/图像到视频、视频延续、多语言对话等功能,并提供草稿模式快速探索创意。开发者可通过 Replicate 直接调用,简化多模态生成开发,降低实验成本。 核心观点: 1. FLUX 3 Video 统一了视频、音频、图像生成及动作预测,是多模态模型。 2. 支持生成最长20秒、最高1080p的视频,具备原生音频和多帧图像到视频功能。 3. 提供 Draft 模式,以较低成本快速探索创意。
Black Forest Labs 发布并开源 Flux 3 视频生成模型,支持文生视频、图生视频、视频参考生成、视频与音频延长、关键帧控制、多语言对话、智能剪辑、文字与动画及图像输出等多种功能。目前模型仅限早期访问申请,未来几周将开放 API 访问,随后开源 Flux 3 Dev 版本。开发者可提前申请体验,为视频生成应用提供新选择。 核心观点: 1. Flux 3 支持文生视频、图生视频及视频参考生成,可基于参考片段生成新视频。 2. 模型提供关键帧控制、智能剪辑和文字动画生成等高级功能。 3. Flux 3 Dev 模型将开源,但当前仅限早期访问,API 将在未来几周开放。
MiniMax 发布开放权重模型 MiniMax M3。该模型总参数量约 428B、激活参数量约 23B,支持 1M-token 上下文窗口与原生多模态理解,并具备前沿编码与 Agent 能力。模型权重已上架 Hugging Face,同时发布了 MiniMax Sparse Attention 论文。开发者可直接下载部署,在超长上下文、多模态及 Agent 场景中进行应用开发与评测。 核心观点: 1. MiniMax M3 总参数量约 428B,激活参数量约 23B,以开放权重形式发布。 2. 模型支持 1M-token 上下文窗口,具备原生多模态理解及前沿编码与 Agent 能力。 3. 权重已上架 Hugging Face,并配套发布 MiniMax Sparse Attention 技术论文。
Google 本周密集发布多款 AI 产品与技术更新:推出 Gemini 3.5 Live Translate 实时语音翻译音频模型;升级 NotebookLM,新增聊天智能体能力、增强推理及多种输出格式;Project Genie 向全球 Google AI Ultra 5x 订阅者开放;Gemini App 的 Notebooks 扩展至欧洲经济区等地;并开源实验性文本扩散模型 DiffusionGemma。对开发者而言,DiffusionGemma 提供了探索非自回归文本生成的新路径,NotebookLM 的升级则强化了 AI 智能体在知识工作流中的实用价值。 核心观点: 1. NotebookLM 升级新增聊天智能体能力、更高级推理及新输出格式套件。 2. Project Genie 现面向 Google AI Ultra 5x 订阅者全球推出。 3. DiffusionGemma 是实验性开放模型,采用文本扩散方法实现极快的文本生成。
Google DeepMind 发布了 Gemma 4 12B 模型,这是一款统一的无编码器多模态模型,旨在为开发者提供轻量级的多模态能力。该模型无需传统编码器即可处理多种输入模态,降低了部署复杂度。对开发者而言,这意味着可以在资源受限的环境中集成多模态功能,拓展了轻量级 AI 应用的可能性。 核心观点: 1. Gemma 4 12B 采用无编码器架构,简化了多模态模型的部署流程。 2. 该模型为 12B 参数规模的轻量级设计,适合资源受限的开发场景。
腾讯混元联合上海交通大学、新加坡南洋理工大学等多所高校发布MMAE,这是首个大规模多任务音频编辑基准。MMAE要求AI理解现有音频并根据自然语言指令精确修改,而非简单生成。基准包含2000个真实场景样本、17741个细粒度评估项,覆盖7种模态、6级任务复杂度、8种操作类型。当前模型精确匹配率(EMR)低于5%,揭示了可靠音频编辑能力的重大缺口,为开发者提供了明确的评测标准。 核心观点: 1. MMAE包含2000个高保真样本和17741个细粒度评估项,覆盖声音、音乐、语音及其混合共7种模态。 2. 当前模型在MMAE上的精确匹配率(EMR)低于5%,表明音频编辑能力存在显著不足。 3. MMAE设计了6级任务复杂度,从基础修改到多跳推理和多轮编辑,以及8种操作类型覆盖局部和全局粒度。
Google 本周密集发布多款 AI 产品。Gemma 4 12B 作为统一的 encoder-free 多模态模型,支持笔记本端完全离线运行,并通过 Quantization-Aware Training (QAT) 降低内存占用;Nano Banana 2 与 Nano Banana Pro 企业智能体平台正式商用;Co-Scientist 科研多智能体系统可生成并优化科学假设;Magenta RealTime 2 开放权重实时音乐模型支持 MIDI 与手势交互。对开发者而言,端侧部署与企业智能体工具链得到显著增强。 核心观点: 1. Gemma 4 12B 采用 encoder-free 架构,支持笔记本完全离线运行多模态任务。 2. Gemma 4 及其 drafters 经 Quantization-Aware Training (QAT) 优化,可降低内存需求并最大化端侧性能。 3. Magenta RealTime 2 为开放权重实时音乐模型,支持通过 MIDI 键盘、文本提示和手势进行演奏交互。
微软AI发布MAI-Image-2.5图像生成与编辑模型,具备强照片级真实感、精确编辑和细节处理能力。该模型宣传图由自身生成,用户可通过Playground或OpenRouter体验。