精讲 1
产品Meng Shao @shao__meng本月精选67/100
正文内容概括Google 工程负责人 Addy Osmani 开源了 Agent Skills 项目,旨在解决 AI 编码智能体默认走捷径、产出不可靠代码的问题。该项目将资深工程师的生产级工程纪律固化为一个六阶段生命周期(DEFINE → PLAN → BUILD → VERIFY → REVIEW → SHIP)和 24 个可执行的技能,强制智能体遵循规格、测试、评审等流程。对开发者而言,这提供了一套可复用的工程化框架,能显著提升 AI 生成代码的质量与可靠性。
核心观点:
1. doubt-driven-development 技能通过 CLAIM → EXTRACT → DOUBT → RECONCILE → STOP 流程,针对高代价决策进行对抗性复盘,并支持跨模型升级。
2. source-driven-development 技能要求框架决策必须引用官方文档并标注未验证项,直接对抗 LLM 编造 API 的问题。
3. deprecation-and-migration 技能将代码视为负债,并配套强制与建议性弃用模式及僵尸代码清除机制。
核心观点提炼高信息密度,值得细读
产品AI Agent工程纪律工作流代码质量开源
精讲 2
技巧Claude Blog本周精选65/100
正文内容概括Anthropic 官方博客解释了 Claude Code 中模型选择与 effort 级别的区别,指导开发者根据任务复杂度选择模型和调整 effort 级别。
核心观点提炼常规快讯,保留列表
技巧
精讲 3
产品Claude Blog本周精选64/100
正文内容概括Anthropic 将 Claude Cowork 扩展到移动端和网页端,支持跨设备会话、后台持续运行和移动端审批,并延长了使用额度促销期。
核心观点提炼常规快讯,保留列表
产品
精讲 4
技巧Meng Shao @shao__meng本周精选65/100
正文内容概括在 Claude Fable 5 即将从订阅计划中移除的背景下,@EXM7777 提出了一套方法论,旨在将顶级模型的高价值判断与思考方式提纯为可永久复用的资产。核心是“可重做性测试”筛选标准,即判断任务是否依赖顶级模型的独特判断力。具体包括五个动作:将判断力植入工作区、进行顾问式审计、构建第二大脑、设置无人值守的高价值产出目标、以及安装思考方式记录器。这些方法帮助开发者和研究者将前沿模型的短暂能力转化为长期可用的资产。
核心观点:
1. 可重做性测试是核心筛选标准:能重做的任务(如建网站)跳过,不能重做的(依赖顶级判断力)才做。
2. 动作1要求将判断力写入CLAUDE.md,形成弱模型也能执行的标准化操作手册。
3. 动作5的思考方式记录器通过SKILL.md自动记录推理过程,实现资产的自动复利。
核心观点提炼高信息密度,值得细读
技巧模型蒸馏知识资产化工作流优化自动化成本控制
精讲 5
技巧Meng Shao @shao__meng本周精选66/100
正文内容概括Claude 开发者团队分享了两种多智能体模式:Advisor(顾问)模式和 Orchestrator(编排者)模式,通过组合 Sonnet 5 和 Fable 5 实现接近顶级模型性能并大幅降低成本。Advisor 模式中 Sonnet 5 作为执行者,低频率调用 Fable 5 获取建议,在 SWE-bench Pro 上达到 Fable 5 约 92% 的性能,成本仅约 63%。Orchestrator 模式中 Fable 5 作为编排者规划并委派任务给多个 Sonnet 5 worker,在 BrowseComp 上达到 Fable 5 约 96% 的性能,成本仅约 46%。开发者可根据任务类型选择模式以优化性价比。
核心观点:
1. Advisor 模式在 SWE-bench Pro 上以 $1.40 成本实现 ~84% 准确率,相比纯 Fable 5 的 $2.25 成本节省约 37%。
2. Orchestrator 模式在 BrowseComp 上以 $18.53 成本实现 86.8% 准确率,相比纯 Fable 5 的 $40.56 成本节省约 54%。
3. Orchestrator 模式相比纯 Sonnet 5 准确率提升约 9 个百分点,成本仅增加约 $2.5。
核心观点提炼高信息密度,值得细读
技巧多智能体成本优化SWE-benchBrowseComp模型组合
精讲 6
产品Anthropic Newsroom本周精选64/100
正文内容概括阿尔伯塔省政府使用Claude Code在20小时内扫描4.66亿行代码并修复安全漏洞,将原本需数年的工作大幅缩短。
核心观点提炼常规快讯,保留列表
产品
精讲 7
技术Meng Shao @shao__meng本周精选67/100
正文内容概括Claude Code 官方提出「Loops」设计范式,将 Agent 工程从经验直觉提升为可复用设计语言。该范式定义了四种循环类型:Turn-based、Goal-based、Time-based 和 Proactive,每种类型由触发、停止、工件和适用场景四个变量确定。文章还强调了关键工程实践,如自验证、事件驱动优先、模型分级路由等。对开发者而言,这提供了一套系统化的 Agent 设计方法论,有助于提升复杂任务的自动化程度和可靠性。
核心观点:
1. 四种循环类型(Turn-based、Goal-based、Time-based、Proactive)由触发、停止、工件、适用场景四个变量确定,可组合使用。
2. Goal-based 循环的有效性取决于退出标准的可确定性,确定性指标(如测试通过数、分数阈值)效果最好。
3. Proactive 循环中,模型分级路由是关键成本控制手段:routine 用小模型,判断性决策用最强模型。
核心观点提炼高信息密度,值得细读
技术Agent设计范式循环类型工程实践成本控制
精讲 8
技术Meng Shao @shao__meng本周精选67/100
正文内容概括Lilian Weng 系统梳理了通过 Harness Engineering 推动 AI 递归式自我改进(RSI)的方法。她认为 RSI 短期内不会从模型直接重写权重开始,而是从模型改进其部署系统(harness)开始。文章归纳了 Workflow Automation、File System as Persistent Memory、Sub-agent & Backend Jobs 三类基础设计模式,并深入探讨了 Context Engineering、Workflow Design、Self-Improving Harness、Evolutionary Search 等优化路径。最后指出了评估器弱、记忆退化、多样性坍缩等七大瓶颈。对开发者而言,这提供了从系统设计角度实现 AI 自我改进的实用框架。
核心观点:
1. STOP 递归改进在 GPT-4 上有效,但在 GPT-3.5/Mixtral 上反而退化,说明基座模型强度是关键前提。
2. Self-Harness 通过 weakness mining、bounded edits 和 held-in/held-out 双重回归测试,能学到 model-specific 指令。
3. Darwin Gödel Machine 在 SWE-bench Verified 上从 20% 提升到 50%,但仅在评估易量化的领域有效。
核心观点提炼高信息密度,值得细读
技术RSIHarness EngineeringContext EngineeringEvolutionary SearchSelf-Improving Harness
精讲 9
产品宝玉 @dotey本周精选67/100
正文内容概括Anthropic 联合创始人 Ben Mann 及团队回顾了 Claude Code 从 2022 年 VS Code 插件到命令行工具的研发历程。早期模型在智能体编程上表现糟糕,团队通过强化学习训练逐步突破,解决了 bash 工具、代码执行环境等关键问题。2024 年 Labs 团队成立后,Boris Cherny 将内部工具 clide 重构为 Claude CLI,最终演变为 Claude Code。该历程揭示了强化学习训练和智能体架构在编程自动化中的核心作用。
核心观点:
1. Claude Code 的智能体能力源于 2022 年搭建的强化学习代码库,从简单函数编写逐步升级到自主软件工程。
2. 早期 clide 工具已支持并发启动 100 个 Claude Haiku 处理超上下文窗口的代码库。
3. Boris Cherny 在两天内用 API 原型出 Claude CLI,核心元素已包含截图读取 Apple Music 等自主操作。
核心观点提炼高信息密度,值得细读
产品强化学习智能体架构命令行工具编程自动化代码执行环境
精讲 10
产品Sakana AI @SakanaAILabs当日精选61/100
正文内容概括Sakana AI 发布了翻译功能 Sakana Translate,支持日英中双向翻译并可转换为口语、简洁、大阪方言等风格。
核心观点提炼常规快讯,保留列表
产品
精讲 11
技术OpenAI Blog当日精选65/100
正文内容概括Meta-Harness R&D 提出了一种企业级自主代码改进方法,旨在让长周期AI工作流的自我提升更可控、更规范。
核心观点提炼常规快讯,保留列表
技术
精讲 12
讨论BAIR Blog当日精选64/100
正文内容概括伯克利研究团队提出智能成本趋近于零后,数据系统需为智能体重新设计,涵盖面向、管理和由智能体构建三大挑战。
核心观点提炼常规快讯,保留列表
讨论
精讲 13
技巧AYi @AYi_AInotes当日精选58/100
正文内容概括AYi 拆解 Claude Code 的四种循环模式,从手动提示转向自动迭代,按控制权选择回合制或自动循环。
核心观点提炼常规快讯,保留列表
技巧
精讲 14
产品Cat Wu @_catwu当日精选54/100
正文内容概括用户称赞 Claude Fable 5 在留存分析中主动使用倾向得分匹配,体现模型判断力提升。
核心观点提炼常规快讯,保留列表
产品
精讲 15
产品Chubby @kimmonismus当日精选63/100
正文内容概括GPT-5.6 Sol 在 30 小时内超越了 Claude Opus 64 小时运行的加速效果,虽输出不更优但优化更持久。
核心观点提炼常规快讯,保留列表
产品
精讲 16
技巧AYi @AYi_AInotes当日精选57/100
正文内容概括分享一个在Codex、Claude code中强制AI复用成熟开源方案而非从零造轮子的prompt技巧,可减少代码量和bug。
核心观点提炼常规快讯,保留列表
技巧
精讲 17
产品Simon Willison当日精选52/100
正文内容概括Simon Willison 用 GPT-5.5 构建了一个实验性 Web Component,用于嵌入 GitHub 代码片段并显示指定行范围。
核心观点提炼常规快讯,保留列表
产品
精讲 18
产品Claude Devs @ClaudeDevs当日精选54/100
正文内容概括Claude 将 Claude Fable 5 的访问权限延长至所有付费计划用户,截止日期为 7 月 12 日。
核心观点提炼常规快讯,保留列表
产品
精讲 19
产品AI at Meta @AIatMeta当日精选61/100
正文内容概括Meta 发布 Muse Image 模型,在图像生成竞技场排名第二,仅次于 OpenAI 的 GPT Image 2,覆盖文生图、单图编辑和多图编辑三项任务。
核心观点提炼常规快讯,保留列表
产品
精讲 20
技巧OpenRouter @OpenRouter当日精选57/100
正文内容概括OpenRouter 测试了 5 个模型在 1730 道视觉推理题上使用低分辨率图片的效果,发现该技巧常导致推理成本反而增加。
核心观点提炼常规快讯,保留列表
技巧
精讲 21
技巧Peter Steinberger @steipete当日精选56/100
正文内容概括开发者分享使用 Fable 5 作为顾问、Sonnet 5 作为执行者的工作流模式,并建议让 Codex 成为主力工具。
核心观点提炼常规快讯,保留列表
技巧
精讲 22
产品Meng Shao @shao__meng当日精选58/100
正文内容概括OPC Skills 发布面向一人公司的 Agent Skills 开源库,包含10个技能分4类,累计51K+次安装,覆盖市场调研、数据采集、设计生产和增长基建。
核心观点提炼常规快讯,保留列表
产品
精讲 23
产品Sakana AI @SakanaAILabs当日精选64/100
正文内容概括Sakana AI 成为 Merge Gateway 模型供应商,发布多智能体编排模型 Fugu Ultra,支持百万 token 上下文窗口和零数据保留。
核心观点提炼常规快讯,保留列表
产品
精讲 24
产品AI at Meta @AIatMeta当日精选67/100
正文内容概括Meta 旗下 MSL 发布首个智能图像生成模型 Muse Image,与 Muse Spark 配合可推理提示词、搜索网络并规划后生成,已在 Meta AI 应用上线。
核心观点提炼常规快讯,保留列表
产品
精讲 25
产品Claude Blog当日精选59/100
正文内容概括Anthropic 将 Claude Code 和 Claude Cowork 以公开测试版形式引入政府桌面版,通过 FedRAMP High 授权环境提供,并新增治理、计费与审计功能。
核心观点提炼常规快讯,保留列表
产品
精讲 26
产品AYi @AYi_AInotes当日精选64/100
正文内容概括Cloudflare 推出 Monetization Gateway,基于 x402 协议将支付嵌入 HTTP 底层,支持 AI Agent 自主完成微交易结算。
核心观点提炼常规快讯,保留列表
产品
精讲 27
产品Unsloth AI @UnslothAI当日精选65/100
正文内容概括Unsloth 发布了 DeepSeek-V4 的 GGUF 量化版本,支持 168GB RAM 无损运行和 110GB 3-bit 部署,并改进了聊天模板。
核心观点提炼常规快讯,保留列表
产品
精讲 28
产品OpenAI Developers @OpenAIDevs当日精选67/100
正文内容概括ChatGPT iOS 更新发布 Codex Remote 大版本,新增线程管理、差异过滤和 SSH 密钥登录功能。
核心观点提炼常规快讯,保留列表
产品
精讲 29
技术Import AI当日精选63/100
正文内容概括Import AI 第464期报道了Fable编写GPU内核、AI自动化以及模拟计算等多项AI研究进展。
核心观点提炼常规快讯,保留列表
技术
精讲 30
技巧AYi @AYi_AInotes当日精选59/100
正文内容概括一个开源项目让 Claude Code 通过 FFmpeg 场景检测和 Whisper 字幕转写实现长视频分析,看完后可将内容存入知识库。
核心观点提炼常规快讯,保留列表
技巧