[开源推荐] Qwen-MM-Plugins 千问团队开源的「原生多模态插件集」,把"读图 / 读视频 / 读文档 / 听音 / 建模"等视觉与多模态能力,以 MCP 形式注入任意 Agent h...
AI 摘要
千问团队开源了Qwen-MM-Plugins多模态插件集,以MCP形式将视觉、视频、音频、3D建模等能力注入智能体框架,使纯文本智能体获得多模态能力。该项目采用Skill+MCP双层解耦,提供七大能力模块,包括视觉基础、长视频记忆、音视频理解、生成剪辑、3D建模、CAD和讲题视频生成,降低了多模态智能体的开发门槛。 核心观点: 1. 项目采用Skill+MCP双层解耦,Skill是模型侧提示词资产,MCP server是工具本体,进程隔离依赖隔离。 2. 长视频记忆模块支持2小时级超长视频问答,首次提问自动构建层次化图记忆与语义检索。 3. 提供七大能力模块,覆盖视觉基础、音视频理解、生成剪辑、3D建模、CAD等,可灵活组合。
推荐理由高信息密度,值得细读
原文
千问团队开源的「原生多模态插件集」,把"读图 / 读视频 / 读文档 / 听音 / 建模"等视觉与多模态能力,以 MCP 形式注入任意 Agent harness,让纯文本 Agent 一键升级为多模态原生 Agent https://github.com/QwenLM/Qwen-MM-Plugins
# 项目核心理念:Skill + MCP 的双层解耦
一个能力 = 一个 Skill + 一个可选 MCP server · Skill:写给模型看的 SKILL.md,告诉模型"存在这套工具、何时该用",本质是模型侧的提示词资产。 · MCP server:工具本体,由 uvx 在首次调用时按需拉起,进程隔离、依赖隔离。
# 七大能力模块
1. core - 视觉基础 动态分辨率读取(图/视频/文档/3D)、OCR、grounding、SAM3 分割、ASR、视觉对话、Serper 联网搜索
2. video-memory - 长视频记忆 层次化图记忆 + 语义检索,支撑 2 小时级超长视频问答,首次提问自动构建 memory 3. omni-av - 音视频原生理解 基于 Qwen-Omni,带时间戳/说话人标签的 ASR、时序定位、事件计数、音乐标签
4. video-edit - 生成与剪辑 图/视频/音频生成 + 剪辑工作流
5. blender - 3D 建模瘦客户端 22 个工具驱动正在运行的 Blender(Python thin client),建模/材质/灯光/渲染
6. freecad - 参数化 CAD 瘦客户端 14 个工具驱动 FreeCAD,含 STEP/STL 导入导出与 FEM 分析
7. edu-agent - 讲题视频生成 纯 Skill,把数学/理科题转成中文逐步讲解视频(基于 HyperFrames)
金句
一个能力 = 一个 Skill + 一个可选 MCP server
把"读图 / 读视频 / 读文档 / 听音 / 建模"等视觉与多模态能力,以 MCP 形式注入任意 Agent harness
讨论
暂无评论。