精讲 1
产品Meng Shao @shao__meng本月精选67/100
正文内容概括Google 工程负责人 Addy Osmani 开源了 Agent Skills 项目,旨在解决 AI 编码智能体默认走捷径、产出不可靠代码的问题。该项目将资深工程师的生产级工程纪律固化为一个六阶段生命周期(DEFINE → PLAN → BUILD → VERIFY → REVIEW → SHIP)和 24 个可执行的技能,强制智能体遵循规格、测试、评审等流程。对开发者而言,这提供了一套可复用的工程化框架,能显著提升 AI 生成代码的质量与可靠性。
核心观点:
1. doubt-driven-development 技能通过 CLAIM → EXTRACT → DOUBT → RECONCILE → STOP 流程,针对高代价决策进行对抗性复盘,并支持跨模型升级。
2. source-driven-development 技能要求框架决策必须引用官方文档并标注未验证项,直接对抗 LLM 编造 API 的问题。
3. deprecation-and-migration 技能将代码视为负债,并配套强制与建议性弃用模式及僵尸代码清除机制。
核心观点提炼高信息密度,值得细读
产品AI Agent工程纪律工作流代码质量开源
精讲 2
产品OpenAI Developers @OpenAIDevs本周精选67/100
正文内容概括OpenAI 演示了通过文本指令生成3D场景的能力,无需编写代码或上传资产,展示了AI的自主创作潜力。
核心观点提炼常规快讯,保留列表
产品
精讲 3
产品OpenAI Developers @OpenAIDevs本周精选73/100
正文内容概括GPT-5.6 从单个提示自动构建完整训练管道,在本地 Mac 上基于 iMessage 历史训练模型,能模仿用户写作风格生成回复。
核心观点提炼常规快讯,保留列表
产品
精讲 4
产品OpenAI Developers @OpenAIDevs本周精选71/100
正文内容概括OpenRouter 宣布 GPT-5.6 模型上线,提供 Sol、Terra 和 Luna 三种变体,早期测试显示其 token 效率更高、成本更低。
核心观点提炼常规快讯,保留列表
产品
精讲 5
产品jason@jxnlco @jxnlco本周精选66/100
正文内容概括OpenAI 发布了统一插件目录,允许开发者在 ChatGPT 和 Codex 中提交插件,并带来共享发现、安装和认证等功能。
核心观点提炼常规快讯,保留列表
产品
精讲 6
产品Anthropic Newsroom本周精选53/100
正文内容概括Anthropic 发布了 Claude 的反思功能(beta),让用户追踪和可视化使用模式并设置使用边界,以更好地整合 AI 到日常生活。
核心观点提炼常规快讯,保留列表
产品
精讲 7
产品Meng Shao @shao__meng本周精选58/100
正文内容概括Vercel Labs 开源 Native SDK,保留 Web 声明式 UI 体验,用自研引擎替代浏览器/WebView 直接绘制到 OS 窗口。基于 Zig 实现 Elm 架构,dev 模式热重载约2秒,release 模式编译时解析,二进制仅几 MB。内置 automation server 和 CLI agent skills,支持 AI 智能体读取 accessibility 快照、驱动 widget。开发者可用声明式范式构建高性能原生桌面应用,并集成 AI 自动化。
核心观点:
1. Native SDK 采用 Zig 实现 Elm 架构(Model/Msg/update/View),dev 模式热重载约2秒,release 模式 markup 编译进二进制,体积仅几 MB。
2. 自研引擎直接绘制到 OS 窗口,无浏览器/WebView,通过结构性 identity 和 keyed 列表确保跨重建状态稳定。
3. 内置 automation server,任何 agent 可读取 accessibility 快照、驱动 widget、断言状态,CLI 自带 agent skills。
核心观点提炼高信息密度,值得细读
产品原生桌面应用声明式UIZig热重载AI自动化
精讲 8
技术OpenAI Blog本周精选70/100
正文内容概括OpenAI 发布分析报告,指出 SWE-Bench Pro 编码基准测试存在可靠性问题,引发对 AI 模型评估准确性的担忧。该发现对开发者评估 AI 编码能力的方法提出了挑战。
核心观点提炼高信息密度,值得细读
技术SWE-Bench Pro编码基准测试评估可靠性
精讲 9
产品Meng Shao @shao__meng本周精选58/100
正文内容概括OPC Skills 发布面向一人公司的 Agent Skills 开源库,包含10个技能分4类,累计51K+次安装,覆盖市场调研、数据采集、设计生产和增长基建。
核心观点提炼常规快讯,保留列表
产品
精讲 10
产品OpenAI Blog本周精选70/100
正文内容概括OpenAI 发布了新一代语音模型 GPT-Live,旨在提升 ChatGPT 语音交互的自然度。该模型现已用于 ChatGPT Voice 功能,为开发者提供了更流畅、更接近真人对话的语音交互能力。
核心观点提炼高信息密度,值得细读
产品语音模型自然交互ChatGPT
精讲 11
技巧Claude Blog本周精选65/100
正文内容概括Anthropic 官方博客解释了 Claude Code 中模型选择与 effort 级别的区别,指导开发者根据任务复杂度选择模型和调整 effort 级别。
核心观点提炼常规快讯,保留列表
技巧
精讲 12
产品Claude Blog本周精选64/100
正文内容概括Anthropic 将 Claude Cowork 扩展到移动端和网页端,支持跨设备会话、后台持续运行和移动端审批,并延长了使用额度促销期。
核心观点提炼常规快讯,保留列表
产品
精讲 13
技巧Meng Shao @shao__meng本周精选65/100
正文内容概括在 Claude Fable 5 即将从订阅计划中移除的背景下,@EXM7777 提出了一套方法论,旨在将顶级模型的高价值判断与思考方式提纯为可永久复用的资产。核心是“可重做性测试”筛选标准,即判断任务是否依赖顶级模型的独特判断力。具体包括五个动作:将判断力植入工作区、进行顾问式审计、构建第二大脑、设置无人值守的高价值产出目标、以及安装思考方式记录器。这些方法帮助开发者和研究者将前沿模型的短暂能力转化为长期可用的资产。
核心观点:
1. 可重做性测试是核心筛选标准:能重做的任务(如建网站)跳过,不能重做的(依赖顶级判断力)才做。
2. 动作1要求将判断力写入CLAUDE.md,形成弱模型也能执行的标准化操作手册。
3. 动作5的思考方式记录器通过SKILL.md自动记录推理过程,实现资产的自动复利。
核心观点提炼高信息密度,值得细读
技巧模型蒸馏知识资产化工作流优化自动化成本控制
精讲 14
技巧Meng Shao @shao__meng本周精选66/100
正文内容概括Claude 开发者团队分享了两种多智能体模式:Advisor(顾问)模式和 Orchestrator(编排者)模式,通过组合 Sonnet 5 和 Fable 5 实现接近顶级模型性能并大幅降低成本。Advisor 模式中 Sonnet 5 作为执行者,低频率调用 Fable 5 获取建议,在 SWE-bench Pro 上达到 Fable 5 约 92% 的性能,成本仅约 63%。Orchestrator 模式中 Fable 5 作为编排者规划并委派任务给多个 Sonnet 5 worker,在 BrowseComp 上达到 Fable 5 约 96% 的性能,成本仅约 46%。开发者可根据任务类型选择模式以优化性价比。
核心观点:
1. Advisor 模式在 SWE-bench Pro 上以 $1.40 成本实现 ~84% 准确率,相比纯 Fable 5 的 $2.25 成本节省约 37%。
2. Orchestrator 模式在 BrowseComp 上以 $18.53 成本实现 86.8% 准确率,相比纯 Fable 5 的 $40.56 成本节省约 54%。
3. Orchestrator 模式相比纯 Sonnet 5 准确率提升约 9 个百分点,成本仅增加约 $2.5。
核心观点提炼高信息密度,值得细读
技巧多智能体成本优化SWE-benchBrowseComp模型组合
精讲 15
产品Anthropic Newsroom本周精选64/100
正文内容概括阿尔伯塔省政府使用Claude Code在20小时内扫描4.66亿行代码并修复安全漏洞,将原本需数年的工作大幅缩短。
核心观点提炼常规快讯,保留列表
产品
精讲 16
技术Meng Shao @shao__meng本周精选67/100
正文内容概括Claude Code 官方提出「Loops」设计范式,将 Agent 工程从经验直觉提升为可复用设计语言。该范式定义了四种循环类型:Turn-based、Goal-based、Time-based 和 Proactive,每种类型由触发、停止、工件和适用场景四个变量确定。文章还强调了关键工程实践,如自验证、事件驱动优先、模型分级路由等。对开发者而言,这提供了一套系统化的 Agent 设计方法论,有助于提升复杂任务的自动化程度和可靠性。
核心观点:
1. 四种循环类型(Turn-based、Goal-based、Time-based、Proactive)由触发、停止、工件、适用场景四个变量确定,可组合使用。
2. Goal-based 循环的有效性取决于退出标准的可确定性,确定性指标(如测试通过数、分数阈值)效果最好。
3. Proactive 循环中,模型分级路由是关键成本控制手段:routine 用小模型,判断性决策用最强模型。
核心观点提炼高信息密度,值得细读
技术Agent设计范式循环类型工程实践成本控制
精讲 17
技术Meng Shao @shao__meng本周精选67/100
正文内容概括Lilian Weng 系统梳理了通过 Harness Engineering 推动 AI 递归式自我改进(RSI)的方法。她认为 RSI 短期内不会从模型直接重写权重开始,而是从模型改进其部署系统(harness)开始。文章归纳了 Workflow Automation、File System as Persistent Memory、Sub-agent & Backend Jobs 三类基础设计模式,并深入探讨了 Context Engineering、Workflow Design、Self-Improving Harness、Evolutionary Search 等优化路径。最后指出了评估器弱、记忆退化、多样性坍缩等七大瓶颈。对开发者而言,这提供了从系统设计角度实现 AI 自我改进的实用框架。
核心观点:
1. STOP 递归改进在 GPT-4 上有效,但在 GPT-3.5/Mixtral 上反而退化,说明基座模型强度是关键前提。
2. Self-Harness 通过 weakness mining、bounded edits 和 held-in/held-out 双重回归测试,能学到 model-specific 指令。
3. Darwin Gödel Machine 在 SWE-bench Verified 上从 20% 提升到 50%,但仅在评估易量化的领域有效。
核心观点提炼高信息密度,值得细读
技术RSIHarness EngineeringContext EngineeringEvolutionary SearchSelf-Improving Harness
精讲 18
产品宝玉 @dotey本周精选67/100
正文内容概括Anthropic 联合创始人 Ben Mann 及团队回顾了 Claude Code 从 2022 年 VS Code 插件到命令行工具的研发历程。早期模型在智能体编程上表现糟糕,团队通过强化学习训练逐步突破,解决了 bash 工具、代码执行环境等关键问题。2024 年 Labs 团队成立后,Boris Cherny 将内部工具 clide 重构为 Claude CLI,最终演变为 Claude Code。该历程揭示了强化学习训练和智能体架构在编程自动化中的核心作用。
核心观点:
1. Claude Code 的智能体能力源于 2022 年搭建的强化学习代码库,从简单函数编写逐步升级到自主软件工程。
2. 早期 clide 工具已支持并发启动 100 个 Claude Haiku 处理超上下文窗口的代码库。
3. Boris Cherny 在两天内用 API 原型出 Claude CLI,核心元素已包含截图读取 Apple Music 等自主操作。
核心观点提炼高信息密度,值得细读
产品强化学习智能体架构命令行工具编程自动化代码执行环境
精讲 19
产品Meng Shao @shao__meng本周精选64/100
正文内容概括腾讯正式开源 Hy3 模型,采用 295B/A21B MoE 架构与 256K 上下文窗口。相比预览版,任务成功率从 72% 提升至 90%,执行效率平均缩短 34%,文档处理 token 节省 47.4%,PPT 制作节省 49.0%(对比 GLM-5.2)。该模型已在元宝、ima、QQ 浏览器、微信读书、腾讯文档等产品中应用,形成数据循环强化。对开发者而言,Hy3 开源提供了高性价比的 MoE 大模型选择。
核心观点:
1. Hy3 采用 295B/A21B MoE 架构,上下文窗口达 256K。
2. 相比 Hy3 preview,任务成功率从 72% 提升至 90%,执行效率平均缩短 34%。
3. 文档处理 token 节省 47.4%,PPT 制作节省 49.0%(对比 GLM-5.2)。
核心观点提炼高信息密度,值得细读
产品MoE开源上下文窗口成本优化腾讯
精讲 20
产品jason@jxnlco @jxnlco当日精选68/100
正文内容概括ChatGPT Work 新增云端浏览器和桌面浏览器功能,可自主浏览公共网站、比较选项并完成多步骤任务。用户能检查截图、重放步骤和批准操作,桌面浏览器使用独立配置文件确保数据隔离。这提升了 AI 执行复杂任务的能力,但需注意权限控制与数据安全。
核心观点:
1. 云端浏览器支持多步骤任务执行,用户可检查截图、重放步骤并批准操作。
2. 桌面浏览器使用独立配置文件,确保用户现有标签、cookies 和密码保持隔离。
3. 网站访问和敏感操作需用户授权,保障安全性。
核心观点提炼高信息密度,值得细读
产品浏览器自动化数据隔离多步骤任务桌面应用
精讲 21
产品jason@jxnlco @jxnlco当日精选68/100
正文内容概括ChatGPT 发布了 Sites 公开测试版,允许用户将提示、文件或想法直接转化为可分享的仪表板、项目跟踪器或轻量级应用。
核心观点提炼常规快讯,保留列表
产品
精讲 22
产品Cline @cline当日精选69/100
正文内容概括OpenAI 发布了 GPT-5.6 模型,在 Terminal-Bench 基准测试上达到 91.9% 的新纪录。该模型定价与 GPT-5.5 相同,为每百万 tokens 输入 5 美元、输出 30 美元。相比之下,Claude 的 Fable 模型被从订阅中移除并转向 API,成本更高(每百万 tokens 输入 10 美元、输出 50 美元)。这一发布对开发者意味着在保持成本不变的情况下获得了更强的终端任务性能。
核心观点:
1. GPT-5.6 在 Terminal-Bench 上达到 91.9%,创下新纪录。
2. GPT-5.6 定价与 GPT-5.5 相同,每百万 tokens 输入 5 美元、输出 30 美元。
3. Claude 的 Fable 模型 API 定价为每百万 tokens 输入 10 美元、输出 50 美元,是 GPT-5.6 的两倍。
核心观点提炼高信息密度,值得细读
产品GPT-5.6Terminal-Bench定价成本对比Claude
精讲 23
产品Chubby @kimmonismus当日精选63/100
正文内容概括蚂蚁集团旗下具身AI公司Robbyant发布开源世界模型LingBot-World 2.0,支持720p/60fps实时交互,60分钟无退化,并开源14B和1.3B版本权重与代码。
核心观点提炼常规快讯,保留列表
产品
精讲 24
产品歸藏 @op7418当日精选59/100
正文内容概括OpenAI 取消了 Codex 的五小时使用限制并进行了重置,用户使用不再受时长限制。
核心观点提炼常规快讯,保留列表
产品
精讲 25
技巧Meng Shao @shao__meng当日精选56/100
正文内容概括Emil Kowalski 为 Skills 库新增 /improve-animations 技能,通过 AI 模型分阶段审计动画并制定修复计划,提供动画设计原则与工作流。
核心观点提炼常规快讯,保留列表
技巧
精讲 26
产品Cline @cline当日精选64/100
正文内容概括Cline 发布了 Poolside 的 Laguna M.1 免费模型,拥有 225B 参数和 256k 上下文,专为智能编码和长周期任务优化。
核心观点提炼常规快讯,保留列表
产品
精讲 27
产品jason@jxnlco @jxnlco当日精选62/100
正文内容概括OpenAI 的 GPT-5.6 Sol 在 Design Arena 前端设计基准测试中排名第一,Elo 1353,超越 Claude Fable 5 和 GLM 5.2,比 GPT-5.5 提升 18 位,建立新帕累托前沿。
核心观点提炼常规快讯,保留列表
产品
精讲 28
技巧Peter Steinberger @steipete当日精选52/100
正文内容概括Wispr Flow 的本地字典可通过 SQLite 数据库导入 Codex,合并到 dictationDictionary 字段。
核心观点提炼常规快讯,保留列表
技巧
精讲 29
产品Claude Devs @ClaudeDevs当日精选60/100
正文内容概括Anthropic 将 Claude Fable 5 访问权限扩展至所有付费计划,并维持 Claude Code 周速率限制提高 50% 至 7 月 19 日。
核心观点提炼常规快讯,保留列表
产品
精讲 30
技术Meng Shao @shao__meng当日精选64/100
正文内容概括针对Claude Fable 5等前沿模型的高成本问题,本文提出了一种成本高效的Harness设计方法。核心思路是利用任务中token智能需求的不对称性,仅在关键位置使用Fable 5等前沿模型,其余部分委派给廉价模型。通过Orchestrator、Advisor、Verifier三种分配模式,在Parameter Golf和BrowseComp实验中,以约46%的成本实现了约90%的性能。文章总结了四条设计准则,包括审视任务形状、使用委派启发式、评估协调成本和保证prompt cache命中,为开发者提供了构建经济高效AI系统的实用框架。
核心观点:
1. Parameter Golf实验表明,前置规划无效,Fable 5的真正价值在于中段检查点提供方向纠偏与重新排序。
2. BrowseComp实验中,Fable 5编排+Sonnet worker在完整集(~31M tokens/题)上实现了96%分数/46%成本的套利。
3. 协调成本的两大来源是边界重复(跨模型token计费至少两次)和扇出重叠(worker互不通信、研究范围部分重合)。
核心观点提炼高信息密度,值得细读
技术成本优化模型编排Token效率委派策略Prompt Cache