千问团队开源了Qwen-MM-Plugins多模态插件集,以MCP形式将视觉、视频、音频、3D建模等能力注入智能体框架,使纯文本智能体获得多模态能力。该项目采用Skill+MCP双层解耦,提供七大能力模块,包括视觉基础、长视频记忆、音视频理解、生成剪辑、3D建模、CAD和讲题视频生成,降低了多模态智能体的开发门槛。 核心观点: 1. 项目采用Skill+MCP双层解耦,Skill是模型侧提示词资产,MCP server是工具本体,进程隔离依赖隔离。 2. 长视频记忆模块支持2小时级超长视频问答,首次提问自动构建层次化图记忆与语义检索。 3. 提供七大能力模块,覆盖视觉基础、音视频理解、生成剪辑、3D建模、CAD等,可灵活组合。
YC 开源了其内部用于会计、法务、活动运营等真实业务的多人 Agent 系统 QM。其核心抽象是 scope(作用域),为每个用户、频道、项目提供独立的记忆、文件、密钥和权限,实现个人隔离与协作共享。架构采用 Headless Core 设计,支持替换底层模型(如 Pi、OpenCode、Codex、Claude Code),持久层使用 Postgres 和隔离沙箱。安全提供 Strict、Auto、Dangerous 三种模式。该系统为 Agent 的权限与上下文边界设计提供了参考。 核心观点: 1. QM 通过 scope 作用域按人和空间划分权限与上下文边界,实现个人隔离与协作共享。 2. 架构采用 Headless Core,模型可替换,不绑定单一厂商,体现反锁定立场。 3. 安全模式提供 Strict、Auto、Dangerous 三种,Auto 模式使用分类器进行来源标注和筛查。
腾讯混元开源了端到端推测解码框架AngelSpec,支持训练和部署。在Hy3-A21B模型上,并发数4-64时,DFly实现1.98-2.40倍端到端加速,吞吐量比DFlash高10.5-11.8%。开发者可获取训练代码和drafter权重,便于复现和进一步研究。 核心观点: 1. AngelSpec在Hy3-A21B上实现1.98-2.40倍端到端加速(并发4-64)。 2. AngelSpec吞吐量比DFlash高10.5-11.8%。
OpenAI 开源了 Codex Security 命令行工具和 TypeScript SDK,基于 AI 自动扫描代码漏洞并生成修复补丁。该工具此前为闭源插件,现以 Apache-2.0 协议开源,支持批量扫描、CI 集成和 git commit 前拦截。第三方测试显示,在 16.2 万行生产代码上,Codex Security 真阳性率 74%,优于 Snyk(28%)和 Semgrep(20%)。开发者可将其集成到开发流程中,提升代码安全检测效率。 核心观点: 1. 默认使用 gpt-5.6-sol 模型进行高推理强度扫描,需 Node.js 22+ 和 Python 3.10+。 2. 第三方测试中 Codex Security 真阳性率 74%,Snyk 28%,Semgrep 20%。 3. 支持 install-hook 命令在 git commit 前自动扫描并拦截高危问题。
Moonshot AI 开源了基于 CUTLASS 的高性能 Kimi Delta Attention 内核 FlashKDA,在 SM90+ GPU 上实现 1.72–2.22 倍 prefill 加速。该内核支持 bf16 输入、可变长度批处理,可无缝集成到 flash-linear-attention 库中,为开发者提供高效的注意力计算方案。 核心观点: 1. FlashKDA 在 prefill 阶段实现 1.72–2.22 倍加速(基于 H20 基准测试)。 2. 要求 SM90+ 架构、CUDA 12.9+ 和 PyTorch 2.4+。 3. 内核 API 要求 K=V=128,支持 bf16 输入和可变长度批处理。
移动端AI Agent开发面临系统集成和工具调用限制。OpenMinis发布开源AI Agent,在iOS和Android上通过Linux沙箱实现系统级集成:iOS使用iSH深度定制fork(ARM64 guest),Android使用PRoot。模型仅暴露8个核心工具,设备功能通过沙箱内CLI命令调用,采用Native Offloads机制降低token消耗。支持Skills兼容、记忆分层、权限控制等设计。为移动AI Agent开发提供新思路,降低开发门槛,提高模型可控性和效率。 核心观点: 1. iOS端用iSH深度定制fork(OpenMinis/ish-arm64),改造为ARM64 guest,配合Asbestos JIT解释器,实现进程管理和100+系统调用。 2. 模型仅见8个工具(shell_execute等),20+设备集成通过沙箱CLI命令,Native Offloads将execve()路由到宿主侧原生handler。 3. Agent循环最多200轮,并发工具执行上限10,分级自动压缩与上下文卸载,并设有ToolLoopDetector熔断器。
Atomic Agent 是一款基于 MIT 许可证的开源 Agent 运行时。在 GAIA Level 1 基准测试中,使用相同的 4-bit qwen-3.6-35b 模型和 Apple M4 Max 硬件,Atomic Agent 以 69.8% 的准确率击败 Hermes 的 58.5%,且速度快 1.6 倍(3h12m vs 5h10m)。这一结果展示了开源 Agent 运行时的性能潜力,为开发者提供了更高效的选择。 核心观点: 1. Atomic Agent 在 GAIA Level 1 准确率 69.8%,比 Hermes 的 58.5% 高 11.3 个百分点。 2. 相同硬件和模型下,Atomic Agent 完成 53 任务耗时 3h12m,比 Hermes 快 1.6 倍。 3. Atomic Agent 解决 37/53 任务,Hermes 解决 31/53,多解决 6 个。
Black Forest Labs 发布并开源 Flux 3 视频生成模型,支持文生视频、图生视频、视频参考生成、视频与音频延长、关键帧控制、多语言对话、智能剪辑、文字与动画及图像输出等多种功能。目前模型仅限早期访问申请,未来几周将开放 API 访问,随后开源 Flux 3 Dev 版本。开发者可提前申请体验,为视频生成应用提供新选择。 核心观点: 1. Flux 3 支持文生视频、图生视频及视频参考生成,可基于参考片段生成新视频。 2. 模型提供关键帧控制、智能剪辑和文字动画生成等高级功能。 3. Flux 3 Dev 模型将开源,但当前仅限早期访问,API 将在未来几周开放。
腾讯正式开源 Hy3 模型,采用 295B/A21B MoE 架构与 256K 上下文窗口。相比预览版,任务成功率从 72% 提升至 90%,执行效率平均缩短 34%,文档处理 token 节省 47.4%,PPT 制作节省 49.0%(对比 GLM-5.2)。该模型已在元宝、ima、QQ 浏览器、微信读书、腾讯文档等产品中应用,形成数据循环强化。对开发者而言,Hy3 开源提供了高性价比的 MoE 大模型选择。 核心观点: 1. Hy3 采用 295B/A21B MoE 架构,上下文窗口达 256K。 2. 相比 Hy3 preview,任务成功率从 72% 提升至 90%,执行效率平均缩短 34%。 3. 文档处理 token 节省 47.4%,PPT 制作节省 49.0%(对比 GLM-5.2)。
Google 工程负责人 Addy Osmani 开源了 Agent Skills 项目,旨在解决 AI 编码智能体默认走捷径、产出不可靠代码的问题。该项目将资深工程师的生产级工程纪律固化为一个六阶段生命周期(DEFINE → PLAN → BUILD → VERIFY → REVIEW → SHIP)和 24 个可执行的技能,强制智能体遵循规格、测试、评审等流程。对开发者而言,这提供了一套可复用的工程化框架,能显著提升 AI 生成代码的质量与可靠性。 核心观点: 1. doubt-driven-development 技能通过 CLAIM → EXTRACT → DOUBT → RECONCILE → STOP 流程,针对高代价决策进行对抗性复盘,并支持跨模型升级。 2. source-driven-development 技能要求框架决策必须引用官方文档并标注未验证项,直接对抗 LLM 编造 API 的问题。 3. deprecation-and-migration 技能将代码视为负债,并配套强制与建议性弃用模式及僵尸代码清除机制。
Epic Games 在 Unreal 状态大会上开源了其内部版本控制系统 Lore,采用 MIT 许可。该系统专为解决游戏开发中 Git 处理大文件性能差、Perforce 费用高且生态封闭的痛点而设计,支持完全离线操作、文件去重、按需拉取和全链路 Rust 构建。此举为游戏开发者提供了一个免费、开源且生产级的新选择。 核心观点: 1. Lore 支持完全离线操作,提交、分支切换均在本地完成。 2. 采用文件唯一指纹去重和多 GB 文件拆块存储,按需拉取,仅传输变更部分。 3. 全链路使用 Rust 构建,并官方提供多语言 SDK。
Kimi 发布并开源了 K2.7-Code 模型,针对编码智能体常见的“过度思考”问题进行了优化,相比上一代减少 30% token 消耗。在多项基准测试中性能显著提升:Kimi Code Bench v2 提高 21.8%,Program Bench 提高 11%,MLS Bench Lite 提高 31.5%。模型权重和代码已开源至 Hugging Face,同时预告了即将推出的 6x 高速模式。开发者可通过开放 API 和 Kimi Code 立即使用,并参与 Beta 计划体验新功能。 核心观点: 1. K2.7-Code 通过减少过度思考,在长任务智能体场景下 token 消耗降低 30%,同时 agent 长任务成功率反而提升。 2. Kimi Code Bench v2 提升 21.8%、Program Bench 提升 11%、MLS Bench Lite 提升 31.5%,指令跟随和端到端完成率均有改善。 3. 模型权重和代码已开源至 Hugging Face,并预告即将推出 6x High-Speed Mode 以进一步提升编码效率。