千问团队开源了Qwen-MM-Plugins多模态插件集,以MCP形式将视觉、视频、音频、3D建模等能力注入智能体框架,使纯文本智能体获得多模态能力。该项目采用Skill+MCP双层解耦,提供七大能力模块,包括视觉基础、长视频记忆、音视频理解、生成剪辑、3D建模、CAD和讲题视频生成,降低了多模态智能体的开发门槛。 核心观点: 1. 项目采用Skill+MCP双层解耦,Skill是模型侧提示词资产,MCP server是工具本体,进程隔离依赖隔离。 2. 长视频记忆模块支持2小时级超长视频问答,首次提问自动构建层次化图记忆与语义检索。 3. 提供七大能力模块,覆盖视觉基础、音视频理解、生成剪辑、3D建模、CAD等,可灵活组合。
开源电子书《Claude Code From Scratch》通过约4300行代码(TypeScript和Python两个版本)复现了Claude Code的核心架构,包括Agent Loop、13个工具(支持并行执行和流式早期启动)、4层上下文压缩、语义记忆召回、技能系统、多Agent和MCP集成。全书13章,每章为分步教程,对照真实源码讲解简化实现,帮助开发者理解coding agent的工作原理。 核心观点: 1. 用约4300行代码复现Claude Code核心架构,包括Agent Loop、13个工具、4层上下文压缩等。 2. 提供TypeScript和Python两个版本,每章对照真实源码讲解简化实现。
Thariq 使用 Claude Code 与 Fable 5 将视频剪辑重构为软件工程工作流:通过 Whisper 转写 25GB 素材生成毫秒级时间戳,Subagent 自动筛选最佳镜头,FFmpeg 粗剪,AI 手写 LUTs 调色代码并生成 HTML 交互面板,React/Remotion 实现组件化动画与精准卡点,最终经 Figma MCP 协作渲染 4K 成片。全程无需传统非编软件,展示了 AI 智能体工作流在视频生产中的工程化落地。 核心观点: 1. 多个 Subagent 基于 Whisper 输出的单词级时间戳 JSON,自动剔除含“嗯”“啊”的废片并选出表达最清晰的片段。 2. AI 手写 LUTs 调色代码并生成带滑块的 HTML 网页,供人类调整色温、亮度与对比度,参数自动回传代码。 3. 基于 React/Remotion 将静态图形转为动画组件,利用单词时间戳实现特定词汇触发的精准卡点,无需手动对齐时间轴。