# [开源推荐] Qwen-MM-Plugins 千问团队开源的「原生多模态插件集」，把"读图 / 读视频 / 读文档 / 听音 / 建模"等视觉与多模态能力，以 MCP 形式注入任意 Agent h...

- 来源：Meng Shao
- 发布时间：2026-08-11 10:16
- AIWatch 分数：67
- AIWatch 标记：当日精选
- AIWatch 链接：https://aiwatch.icu/events/evt_01kzqc0wsw5mh02t0x8drmjfs6
- 原文链接：https://x.com/shao__meng/status/2087000193200017530

## 精选理由

高信息密度，值得细读

## AI 摘要

千问团队开源了Qwen-MM-Plugins多模态插件集，以MCP形式将视觉、视频、音频、3D建模等能力注入智能体框架，使纯文本智能体获得多模态能力。该项目采用Skill+MCP双层解耦，提供七大能力模块，包括视觉基础、长视频记忆、音视频理解、生成剪辑、3D建模、CAD和讲题视频生成，降低了多模态智能体的开发门槛。
核心观点：
1. 项目采用Skill+MCP双层解耦，Skill是模型侧提示词资产，MCP server是工具本体，进程隔离依赖隔离。
2. 长视频记忆模块支持2小时级超长视频问答，首次提问自动构建层次化图记忆与语义检索。
3. 提供七大能力模块，覆盖视觉基础、音视频理解、生成剪辑、3D建模、CAD等，可灵活组合。

## 正文

千问团队开源的「原生多模态插件集」，把"读图 / 读视频 / 读文档 / 听音 / 建模"等视觉与多模态能力，以 MCP 形式注入任意 Agent harness，让纯文本 Agent 一键升级为多模态原生 Agent
https://github.com/QwenLM/Qwen-MM-Plugins

# 项目核心理念：Skill + MCP 的双层解耦

一个能力 = 一个 Skill + 一个可选 MCP server
· Skill：写给模型看的 SKILL.md，告诉模型"存在这套工具、何时该用"，本质是模型侧的提示词资产。
· MCP server：工具本体，由 uvx 在首次调用时按需拉起，进程隔离、依赖隔离。

# 七大能力模块

1. core - 视觉基础 动态分辨率读取（图/视频/文档/3D）、OCR、grounding、SAM3 分割、ASR、视觉对话、Serper 联网搜索

2. video-memory - 长视频记忆 层次化图记忆 + 语义检索，支撑 2 小时级超长视频问答，首次提问自动构建 memory
3. omni-av - 音视频原生理解 基于 Qwen-Omni，带时间戳/说话人标签的 ASR、时序定位、事件计数、音乐标签

4. video-edit - 生成与剪辑 图/视频/音频生成 + 剪辑工作流

5. blender - 3D 建模瘦客户端 22 个工具驱动正在运行的 Blender（Python thin client），建模/材质/灯光/渲染

6. freecad - 参数化 CAD 瘦客户端 14 个工具驱动 FreeCAD，含 STEP/STL 导入导出与 FEM 分析

7. edu-agent - 讲题视频生成 纯 Skill，把数学/理科题转成中文逐步讲解视频（基于 HyperFrames）
