这期 AIWatch 精选周刊围绕「product、成本优化、ChatGPT」复盘过去一周的关键变化,先给出编辑导读,再把核心精选和延伸内容串成一条可阅读的脉络。聚焦 30 · 关注 0 · 跟进 10。
如果只想抓住本周主线,先读:Google 发布了 Gemini 3.7 Flash 模型,在编码和智能体任务上显著提升性能,并推出半价优惠 → Meta发布了Muse Glimmer开放权重模型(30B参数,Apache 2.0),专为本地代理设计,支持复杂多步骤任务 → 阿里Qwen实验室发布Qwen 3.8 27B开源模型,默认推理开销极高导致本地生成耗时数十分钟,但模型在视觉和代码生成上表现出色。
本周最值得带走的观察,是「product、成本优化、ChatGPT」已经从单点更新变成连续趋势。
正文内容概括Google 在 Flash 系列基础上发布 Gemini 3.7 Flash,专为编码和智能体任务优化。相比 3.6 Flash,在代码生成、Web 开发、知识工作等基准测试上显著提升,如 FrontierCode 1.1 从 34.4% 升至 43.6%,WebDev Arena Elo 从 1538 升至 1588。同时推出半价优惠,输入 $0.75/1M tokens,输出 $3.75/1M tokens,使开发者能更经济地扩展生产级智能体。模型已集成到 Gemini Spark 等产品中。 核心观点: 1. Gemini 3.7 Flash 在 FrontierCode 1.1 Main 上达 43.6%,较 3.6 Flash 的 34.4% 提升 9.2 个百分点。 2. 在 WebDev Arena 中 Elo 得分从 1538 升至 1588,生成更功能完整的 Web 应用。 3. AutomationBench 得分从 17.0% 升至 30.4%,企业工作流自动化能力显著增强。
核心观点提炼高信息密度,值得细读
正文内容概括Meta发布了Muse Glimmer开放权重模型(30B参数,Apache 2.0),专为本地代理设计,支持复杂多步骤任务。
核心观点提炼常规快讯,保留列表
正文内容概括阿里Qwen实验室发布Qwen 3.8 27B开源模型,默认推理开销极高导致本地生成耗时数十分钟,但模型在视觉和代码生成上表现出色。
核心观点提炼常规快讯,保留列表
正文内容概括Martin Alderson 提出了降低 AI 推理成本的系统方法,包括成本审计、模型替换和 Agent 优化,可帮助团队显著减少开支。
核心观点提炼常规快讯,保留列表
正文内容概括Claude Code 的 /code-review 命令新增 effort 级别,低级别以更低 token 成本超越其他工具,高级别提供更高召回率。
核心观点提炼常规快讯,保留列表
正文内容概括Google对Gemma 4进行了重大改进,提升了工具调用和聊天准确性、可靠性和速度,并提供了更新后的量化版本。
核心观点提炼常规快讯,保留列表
正文内容概括狗哥笔记正式开源拼贴动画B-roll Skill,基于Codex和Gemini Omni Flash实现从口播文稿到竖版拼贴动画的自动化生成工作流。
核心观点提炼常规快讯,保留列表
正文内容概括AIE World's Fair 2026 指出 AI 工程进入新阶段,从用 agent 构建转向围绕 agent 构建系统。
核心观点提炼常规快讯,保留列表
正文内容概括Google DeepMind 发布文章探讨 AI 代理在科学发现中从提出假设到设计实验的潜力,指出验证瓶颈并提出四项政策优先事项。
核心观点提炼常规快讯,保留列表
正文内容概括NVIDIA 发布了 ARDY 实时 AI 动画工具,用户可通过文本描述生成角色动作序列,并在 Hugging Face Spaces 上试用。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI宣布Codex和ChatGPT Work活跃用户达800万,重置使用限制并取消5小时速率限制,鼓励用户探索GPT-5.6 Sol的边界。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 发布 GPT-5.6 构建指南,教初创公司用新模型和 Responses API 构建更快更省的 AI 代理。
核心观点提炼常规快讯,保留列表
正文内容概括MiniMax M3 在 Long-Horizon Terminal-Bench 上取得第7名,开源权重第1名,展示了其在长周期终端任务上的竞争力。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 通过教程展示销售团队如何利用 ChatGPT Work 从实际工作输入中创建管道简报、会议准备包等文档,提升销售效率。
核心观点提炼常规快讯,保留列表
正文内容概括JetBrains 将 OpenAI Codex 设为 AI 助手的推荐智能体,用户可随时切换,下月将重新评估。
核心观点提炼常规快讯,保留列表
正文内容概括SambaNovaAI 在 RAISE 会议上展示了其 SN50 系统与 H200 搭配,在 MiniMax M2.7 模型上实现短上下文 850 t/s、长上下文 450+ t/s 的推理速度。
核心观点提炼常规快讯,保留列表
正文内容概括博主分享用AI复刻3D落日飞车游戏的秘诀:先签合同约束AI,分三轮迭代并逐条验收,最终生成单文件HTML游戏。
核心观点提炼常规快讯,保留列表
正文内容概括Codex 现在支持通过命令面板直接访问 Claude Code/Cowork 导入工具,简化了配置迁移流程。
核心观点提炼常规快讯,保留列表
正文内容概括Cursor 发布了 Grok Bot 早期测试版,这是一个 AI 队友,能够登录你的各种工具,像你一样使用它们,并返回已完成的工作成果。
核心观点提炼常规快讯,保留列表
正文内容概括ZCode 宣布用户数突破 100 万,为 GLM Coding Plan 用户重置使用限制,并推出更新提升工程工作流智能与缓存命中率。
核心观点提炼常规快讯,保留列表
正文内容概括ChatGPT桌面应用是OpenAI推出的AI助手原生客户端,此前仅支持Windows和macOS,Linux用户无法在桌面环境直接使用。OpenAI发布了Linux版预览,使Linux用户能在支持的系统上使用ChatGPT、ChatGPT Work和Codex,与本地项目和浏览器工作流集成。这一更新填补了平台空白,让Linux开发者能够更便捷地利用AI进行对话、代码生成和团队协作,无需切换至网页版,从而提升工作效率和开发体验。该预览版标志着ChatGPT桌面应用向跨平台迈出重要一步。
核心观点提炼高信息密度,值得细读
正文内容概括OpenAI 发布了 Codex 和 ChatGPT Work 的导入功能,允许开发者同步来自其他代理的项目、聊天、技能和插件。
核心观点提炼常规快讯,保留列表
正文内容概括Codex/Claude Code 现在支持跨 session 访问会话,开发者可将 Session Id 传递给其他 Agent 以共享上下文,避免手动总结损失信息。
核心观点提炼常规快讯,保留列表
正文内容概括OpenRouter 在 MCP 上发布了任务类型洞察功能,展示各任务下用户实际使用的模型,帮助开发者更精准选型。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 联合 AWS 在 Amazon Bedrock 上发布 Daybreak 网络安全模型,为企业提供 AI 驱动的安全防护能力。
核心观点提炼常规快讯,保留列表
正文内容概括webAI Intelligence Lab 开源了形式化推理模型 TwiL-LM3,仅3B参数在4项基准测试中超越OpenAI的120B模型,推理速度快2.6倍。
核心观点提炼常规快讯,保留列表
正文内容概括千问团队开源了Qwen-MM-Plugins多模态插件集,以MCP形式将视觉、视频、音频、3D建模等能力注入智能体框架,使纯文本智能体获得多模态能力。该项目采用Skill+MCP双层解耦,提供七大能力模块,包括视觉基础、长视频记忆、音视频理解、生成剪辑、3D建模、CAD和讲题视频生成,降低了多模态智能体的开发门槛。 核心观点: 1. 项目采用Skill+MCP双层解耦,Skill是模型侧提示词资产,MCP server是工具本体,进程隔离依赖隔离。 2. 长视频记忆模块支持2小时级超长视频问答,首次提问自动构建层次化图记忆与语义检索。 3. 提供七大能力模块,覆盖视觉基础、音视频理解、生成剪辑、3D建模、CAD等,可灵活组合。
核心观点提炼高信息密度,值得细读
正文内容概括Anthropic 宣布新 Claude 模型将在所有生成文本中嵌入不可见水印,水印随文本复制粘贴而传播,可追溯来源。
核心观点提炼常规快讯,保留列表
正文内容概括Anthropic 宣布为 Claude 输出添加文本水印和 C2PA 数字签名元数据,成为首个在文本层面部署水印的 AI 大模型厂商,全球生效。
核心观点提炼常规快讯,保留列表
正文内容概括黎曼猜想是数学界最著名的未解难题之一,其零点比例问题在过去80年进展缓慢,2020年仅达41.7%。Anthropic的Claude模型通过协调约60个子智能体,运行2400条命令,将零点比例提升至67.2%,创下该问题历史上最大单步提升。Claude还使用Lean形式化证明语言写出可机器验证的证明。这一成果展示了AI在原创数学研究上的能力,对开发者意味着AI可辅助甚至主导前沿数学探索。 核心观点: 1. Claude将零点比例从41.7%提升至67.2%,单步提升26个百分点,超越过去50年进展。 2. Claude协调约60个子智能体,运行2400条命令,写数百Python脚本,实现分工协作。 3. Claude用Lean形式化证明语言写出可机器验证的证明,增强结果可信度。
核心观点提炼重磅首发或硬核洞察
本节暂无内容。
正文内容概括OpenAI 演示了通过文本指令生成3D场景的能力,无需编写代码或上传资产,展示了AI的自主创作潜力。
核心观点提炼常规快讯,保留列表
正文内容概括Claude 开发者团队分享了两种多智能体模式:Advisor(顾问)模式和 Orchestrator(编排者)模式,通过组合 Sonnet 5 和 Fable 5 实现接近顶级模型性能并大幅降低成本。Advisor 模式中 Sonnet 5 作为执行者,低频率调用 Fable 5 获取建议,在 SWE-bench Pro 上达到 Fable 5 约 92% 的性能,成本仅约 63%。Orchestrator 模式中 Fable 5 作为编排者规划并委派任务给多个 Sonnet 5 worker,在 BrowseComp 上达到 Fable 5 约 96% 的性能,成本仅约 46%。开发者可根据任务类型选择模式以优化性价比。 核心观点: 1. Advisor 模式在 SWE-bench Pro 上以 $1.40 成本实现 ~84% 准确率,相比纯 Fable 5 的 $2.25 成本节省约 37%。 2. Orchestrator 模式在 BrowseComp 上以 $18.53 成本实现 86.8% 准确率,相比纯 Fable 5 的 $40.56 成本节省约 54%。 3. Orchestrator 模式相比纯 Sonnet 5 准确率提升约 9 个百分点,成本仅增加约 $2.5。
核心观点提炼高信息密度,值得细读
正文内容概括OpenAI 发布了新一代语音模型 GPT-Live,旨在提升 ChatGPT 语音交互的自然度。该模型现已用于 ChatGPT Voice 功能,为开发者提供了更流畅、更接近真人对话的语音交互能力。
核心观点提炼高信息密度,值得细读
正文内容概括MiniMax 对 H3 开源社区的基准测试和机器人数据集表示期待,Ostris 已生成 1K 视频数据集测试模型能力。
核心观点提炼常规快讯,保留列表
正文内容概括Qwen 发布了 Qwen-MM-Plugins,使智能体能够原生处理图像、视频、文档等多模态内容,并支持视频编辑和3D/CAD操作。
核心观点提炼常规快讯,保留列表
正文内容概括AI Agent规模化部署带来成本挑战。Databricks团队基于实践提出四大成本杠杆:持续迁移到效率更高的开源/低成本模型、动态请求路由(成本降30%+质量持平)、渐进式摩擦替代硬预算、削减Token开销(token量降近50%)。这些策略依赖AI Gateway集中管理模型、预算和日志。对开发者而言,管理AI编码成本的关键是关注效率前沿,通过系统架构而非单纯谈判降价来控制人均成本。 核心观点: 1. 效率前沿推进快于智能前沿,最大杠杆是持续迁移到效率更高的新模型。 2. 动态路由(请求级/任务级/升级委派)可降成本30%+且质量持平最贵模型。 3. 削减Token开销(压缩上下文、话少harness等)实测token量降近50%质量无损。
核心观点提炼高信息密度,值得细读
正文内容概括Anthropic工程师分享构建自主运行Agent循环的方法,让Claude自动修复错误并持续工作,无需人工反复提示。
核心观点提炼常规快讯,保留列表
正文内容概括Amp 用 GPT-5.6 替换 Opus,使平均成本降低约 50% 且性能大幅提升。
核心观点提炼常规快讯,保留列表
正文内容概括Sakana AI 为其多智能体编排产品 Fugu 更新了基于 Gemma 4 的指挥者模型,在保持性能的同时降低了成本。
核心观点提炼常规快讯,保留列表
正文内容概括Ethan Mollick 让 GPT-5.6 Sol in Codex 控制其电脑并成功赢得游戏《Slay the Spire 2》的每日挑战,展示了 AI 代理的自主决策能力。
核心观点提炼常规快讯,保留列表
摘要由 LLM 生成,请以原文为准。