OpenRouter 宣布 GPT-5.6 模型上线,提供 Sol、Terra 和 Luna 三种变体,早期测试显示其 token 效率更高、成本更低
正文内容概括OpenRouter 宣布 GPT-5.6 模型上线,提供 Sol、Terra 和 Luna 三种变体,早期测试显示其 token 效率更高、成本更低。
核心观点提炼常规快讯,保留列表
这期 AIWatch 精选周刊围绕「product、tips、Claude Code」复盘过去一周的关键变化,先给出编辑导读,再把核心精选和延伸内容串成一条可阅读的脉络。聚焦 30 · 关注 0 · 跟进 10。
如果只想抓住本周主线,先读:OpenRouter 宣布 GPT-5.6 模型上线,提供 Sol、Terra 和 Luna 三种变体,早期测试显示其 token 效率更高、成本更低 → OpenAI 发布了 ChatGPT Voice 桌面应用功能,支持语音控制计算机和指挥多个 agent,由 GPT-Live 驱动,提升交互效率 → Kimi_Moonshot 发布 Kimi K3 模型,在 3D Design Arena 中以 Elo 1450 排名第一,较前代 Kimi K2.6 提升 108 Elo。
本周最值得带走的观察,是「product、tips、Claude Code」已经从单点更新变成连续趋势。
正文内容概括OpenRouter 宣布 GPT-5.6 模型上线,提供 Sol、Terra 和 Luna 三种变体,早期测试显示其 token 效率更高、成本更低。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 发布了 ChatGPT Voice 桌面应用功能,支持语音控制计算机和指挥多个 agent,由 GPT-Live 驱动,提升交互效率。
核心观点提炼常规快讯,保留列表
正文内容概括Kimi_Moonshot 发布 Kimi K3 模型,在 3D Design Arena 中以 Elo 1450 排名第一,较前代 Kimi K2.6 提升 108 Elo。
本节暂无内容。
正文内容概括Claude Code 桌面版新增内置浏览器,使 Claude 能像操作本地服务器一样浏览和点击网页,方便开发者查阅文档和设计。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 重置了 ChatGPT Work 和 Codex 的使用限制,承认了发布中的问题并宣布了今日和下周的改进,以提升用户体验。
核心观点提炼常规快讯,保留列表
正文内容概括Claude Code 桌面版新增内置浏览器,可打开并交互任意网站,包括生产应用、文档和社交媒体,扩展了 AI 的网页访问与操作能力。
核心观点提炼常规快讯,保留列表
摘要由 LLM 生成,请以原文为准。
核心观点提炼常规快讯,保留列表
正文内容概括在代理编码会话中,验证是代理检查工作的关键环节。Anthropic介绍了在Claude Code中构建验证循环的方法,包括内置的/verify skill、toolchain、code review等,以及如何将手动检查步骤编码为技能,实现自动化验证。这有助于开发者提升编码代理的迭代效率,减少手动干预。 核心观点: 1. Claude Code内置/verify skill、toolchain、code review等多种验证循环,可自动捕获错误。 2. 自定义验证循环需将手动检查步骤编码为技能,例如拒绝没有回填步骤的列迁移。 3. 使用CLAUDE.md列出精确的构建和测试命令,避免Claude推断。
核心观点提炼高信息密度,值得细读
正文内容概括Anthropic 发布了经济未来研究基金议程,承诺投入2亿美元支持AI经济影响的外部研究,旨在为政策制定提供实证依据。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 展示 GPT-Live 模型改进智能,可同时处理查航班、查天气和制定行程等多任务,保持对话连贯。
核心观点提炼常规快讯,保留列表
正文内容概括随着代码产量激增,代码审查成为瓶颈,尤其是隐性知识难以传达。OpenAI 为 Codex Code Review 推出 AGENTS.md 自定义规则功能,允许团队将审查规则写在代码旁,使 Codex 在审查时应用,将目标 finding 召回率从 58% 提升至 98%。开发者可通过编写规则捕获兼容性要求、数据边界等难以编码的“判断类”知识,从而提升审查质量和效率,规则是对测试和 linter 的补充。 核心观点: 1. 规则是对测试和 linter 的补充,用于承载难以编码的“判断类”知识,机械检查留给 CI。 2. 评测围绕覆盖、克制、保持、可操作性四个维度,其中克制和保持最易被忽视,宽泛指令易制造噪音。 3. 编写规则应从有后果且不显眼的不变量开始,作用域对齐代码,既说不变量也给安全路径,描述结果而非实现细节。
核心观点提炼高信息密度,值得细读
正文内容概括Claude Code团队在炉边对谈中分享系统提示词削减80%的经验。他们发现删除示例(few-shot examples)反而更好,因为当前模型比示例更有创造力;少用“不要做X”的禁令,多给上下文;检验每条指令是否100%成立,避免90%正确的指令导致误读。这些做法依赖Opus/Fable级别模型的判断力,对小模型仍需详细提示词。对开发者而言,提示词工程需从详细指令转向信任模型判断力,并重视评测。 核心观点: 1. 删除示例对Opus/Fable级模型更有效,模型比给定示例更有创造力。 2. 每条指令需检验是否100%成立,避免90%正确指令被误读。 3. 该方法依赖Opus/Fable级模型的判断力,小模型仍需详细提示词。
核心观点提炼高信息密度,值得细读
正文内容概括Anthropic 发布了针对罕见遗传病的 AI for Science 资助计划,提供最高 5 万美元 Claude 积分,旨在加速基础科学和生物技术研究。
核心观点提炼常规快讯,保留列表
正文内容概括Kimi K3 在 Vals AI 的 Vibe Code Bench 上以 85.0% 得分排名第二,该基准测试模型从零创建完整 Web 应用的能力。
核心观点提炼常规快讯,保留列表
正文内容概括Kimi 因 K3 模型需求超预期,暂停新订阅并优先保障现有用户,同时计划拆分会员为通用和代码两个版本。
核心观点提炼常规快讯,保留列表
正文内容概括Cursor团队发现公共基准与开发者实际体验脱节,自研CursorBench。Claude Fable 5在CursorBench上取得72.9%高分,并在实际工程测试中展现全局推理能力,能理解模糊任务意图,无需反复引导。这显著提升开发效率,降低复杂任务门槛,使团队能处理之前搁置的项目,并改变协作方式。 核心观点: 1. Claude Fable 5在CursorBench上达到72.9%准确率(Max effort),创下新高。 2. 在登月模拟实验中,Fable 5通过全局推理成功登月,而Opus仅局部推理失败。 3. Schmidt团队将Fable 5与轻量模型结合,用于最难问题,优化时间成本。
核心观点提炼高信息密度,值得细读
正文内容概括Claude Design作者Nate Parrott分享了十条使用AI设计工具的最佳实践,涵盖prompt技巧、设计系统、迭代方法等,帮助用户提升设计效率。
核心观点提炼常规快讯,保留列表
正文内容概括移动端AI Agent开发面临系统集成和工具调用限制。OpenMinis发布开源AI Agent,在iOS和Android上通过Linux沙箱实现系统级集成:iOS使用iSH深度定制fork(ARM64 guest),Android使用PRoot。模型仅暴露8个核心工具,设备功能通过沙箱内CLI命令调用,采用Native Offloads机制降低token消耗。支持Skills兼容、记忆分层、权限控制等设计。为移动AI Agent开发提供新思路,降低开发门槛,提高模型可控性和效率。 核心观点: 1. iOS端用iSH深度定制fork(OpenMinis/ish-arm64),改造为ARM64 guest,配合Asbestos JIT解释器,实现进程管理和100+系统调用。 2. 模型仅见8个工具(shell_execute等),20+设备集成通过沙箱CLI命令,Native Offloads将execve()路由到宿主侧原生handler。 3. Agent循环最多200轮,并发工具执行上限10,分级自动压缩与上下文卸载,并设有ToolLoopDetector熔断器。
核心观点提炼高信息密度,值得细读
正文内容概括月之暗面兑现承诺,正式开放Kimi k3模型权重,开发者可获取并使用该模型。
核心观点提炼常规快讯,保留列表
正文内容概括多家AI公司联合签署公开信,倡导开放权重模型以促进竞争、安全和广泛采用,呼吁政策制定者支持开放生态系统。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI在Codex中新增语音控制模式,用户称其能力接近AGI,同时提及Opus 5和GPT 5.6 Terra的性能变化。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 发布了 ChatGPT 桌面版语音功能,用户可通过语音输入并阅读模型回答,实现非对称高效交互。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 发布了 ChatGPT Work agent 的新功能,使其能使用需要登录的网站,用户可接管浏览器登录并持久化会话,简化了自动化任务。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 因凌晨全球中断重置了 Codex 和 ChatGPT Work 用户的使用限制,确保用户不受影响,可继续正常使用 AI 编码和聊天工作。
核心观点提炼常规快讯,保留列表
正文内容概括Amjad Masad 部署了一个基于微调LLM的国际象棋引擎,使用GRPO RL训练,目标达到2000+ Elo,目前估计1200 Elo,并提供了教程。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 将新语音模式(Jarvis)集成到 Codex 中,现已对所有 ChatGPT 用户开放,并提供了使用指南。
核心观点提炼常规快讯,保留列表
正文内容概括Anthropic 分享了为 Claude Opus 5 移除 80% Claude Code system prompt 的经验,提供模块化注入开关和编写技巧。
核心观点提炼常规快讯,保留列表
正文内容概括Alex Kotliarskyi 分享了使用 Codex 从图形直接生成工作流脚本的简单实用方法,只需画图并指示 Codex 编写脚本即可自动运行。
核心观点提炼常规快讯,保留列表
正文内容概括BaoCut 发布了视频画面翻译功能,支持 Agent 自动化和导出到剪映,简化了视频翻译工作流。
核心观点提炼常规快讯,保留列表
正文内容概括Perplexity 发布命令行界面(CLI)工具,使编码代理能够直接搜索网络,为开发者提供实时信息检索能力,方便集成到代理工作流中。
核心观点提炼常规快讯,保留列表
正文内容概括Atomic Agent 是一款基于 MIT 许可证的开源 Agent 运行时。在 GAIA Level 1 基准测试中,使用相同的 4-bit qwen-3.6-35b 模型和 Apple M4 Max 硬件,Atomic Agent 以 69.8% 的准确率击败 Hermes 的 58.5%,且速度快 1.6 倍(3h12m vs 5h10m)。这一结果展示了开源 Agent 运行时的性能潜力,为开发者提供了更高效的选择。 核心观点: 1. Atomic Agent 在 GAIA Level 1 准确率 69.8%,比 Hermes 的 58.5% 高 11.3 个百分点。 2. 相同硬件和模型下,Atomic Agent 完成 53 任务耗时 3h12m,比 Hermes 快 1.6 倍。 3. Atomic Agent 解决 37/53 任务,Hermes 解决 31/53,多解决 6 个。
核心观点提炼高信息密度,值得细读
正文内容概括Thariq 分享了移除约80%的Claude Code系统提示后学到的编写系统提示、技能和Claude.MDs的经验,为开发者优化提示提供参考。
核心观点提炼常规快讯,保留列表
正文内容概括Anthropic 砍掉了 Claude Code 80% 的系统提示,总结出少写规则、按需加载技能的新范式,使模型更稳定高效。
核心观点提炼常规快讯,保留列表
正文内容概括提供玻利维亚区Google Play订阅ChatGPT的详细步骤、避坑注意与风险提示,并转述黄仁勋关于开放模型的公开信。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 宣布重置 Codex 和 ChatGPT Work 使用限制,承认发布中的问题并承诺本周和下周推出改进,影响用户使用体验和产品迭代。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 发布了 GPT-5.6 模型,在 Terminal-Bench 基准测试上达到 91.9% 的新纪录。该模型定价与 GPT-5.5 相同,为每百万 tokens 输入 5 美元、输出 30 美元。相比之下,Claude 的 Fable 模型被从订阅中移除并转向 API,成本更高(每百万 tokens 输入 10 美元、输出 50 美元)。这一发布对开发者意味着在保持成本不变的情况下获得了更强的终端任务性能。 核心观点: 1. GPT-5.6 在 Terminal-Bench 上达到 91.9%,创下新纪录。 2. GPT-5.6 定价与 GPT-5.5 相同,每百万 tokens 输入 5 美元、输出 30 美元。 3. Claude 的 Fable 模型 API 定价为每百万 tokens 输入 10 美元、输出 50 美元,是 GPT-5.6 的两倍。
核心观点提炼高信息密度,值得细读
正文内容概括Anthropic内部使用Fable 5的最佳实践指出,强模型时代瓶颈从模型能力转向用户能否在开工前挖掘所有未知,并提供了盲点扫描、多版原型、偏差日志等具体方法。
核心观点提炼低价值或偏离 AI-Dev
正文内容概括Introspection 联合创始人 Roland Gavrilescu 阐述了自改进智能体的反馈循环机制、智能体“配方”以及人类在软件工厂中的核心地位。
核心观点提炼常规快讯,保留列表
正文内容概括Google AI Studio 推出自定义子域名功能,开发者可为应用选择唯一 ai.studio 网址并立即分享,代码和聊天历史保持私密。
核心观点提炼常规快讯,保留列表
正文内容概括BaoCut 发布了基于 Agent Skill 的视频字幕转录、说话人识别、润色与剪辑工具,仅支持 Mac,提供 CLI 和 GUI 协作。
核心观点提炼常规快讯,保留列表
正文内容概括Nick 分享了使用 Codex 处理复杂目标时的提示技巧:要求模型为另一个线程编写目标并监督其解决,从而增加内置引导和额外的品味验证。
核心观点提炼常规快讯,保留列表