今天这期 AIWatch 早报围绕「product、Claude Code、technology」展开,先用一段导语把当天主线收束起来,再按今日头条、推荐精选和补充速览逐条介绍。聚焦 14 · 关注 0 · 跟进 10。
如果只有 20 分钟,先读:Anthropic 介绍了在 Claude Code 中构建验证循环的技能方法,帮助开发者将手动检查步骤自动化,提升编码代理的迭代效率 → Anthropic 发布了经济未来研究基金议程,承诺投入2亿美元支持AI经济影响的外部研究,旨在为政策制定提供实证依据 → OpenAI 展示 GPT-Live 模型改进智能,可同时处理查航班、查天气和制定行程等多任务,保持对话连贯。
今天的主线不是孤立新闻,而是「product、Claude Code、technology」在不同层面的同步推进。
正文内容概括在代理编码会话中,验证是代理检查工作的关键环节。Anthropic介绍了在Claude Code中构建验证循环的方法,包括内置的/verify skill、toolchain、code review等,以及如何将手动检查步骤编码为技能,实现自动化验证。这有助于开发者提升编码代理的迭代效率,减少手动干预。 核心观点: 1. Claude Code内置/verify skill、toolchain、code review等多种验证循环,可自动捕获错误。 2. 自定义验证循环需将手动检查步骤编码为技能,例如拒绝没有回填步骤的列迁移。 3. 使用CLAUDE.md列出精确的构建和测试命令,避免Claude推断。
核心观点提炼高信息密度,值得细读
正文内容概括Anthropic 发布了经济未来研究基金议程,承诺投入2亿美元支持AI经济影响的外部研究,旨在为政策制定提供实证依据。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 展示 GPT-Live 模型改进智能,可同时处理查航班、查天气和制定行程等多任务,保持对话连贯。
核心观点提炼常规快讯,保留列表
正文内容概括ChatGPT 现已支持构建和发布完整 Web 应用,并附有教程视频演示。
核心观点提炼常规快讯,保留列表
正文内容概括腾讯混元发布了Hy3模型的GGUF量化版本,支持llama.cpp直接运行和MTP自推测解码,方便开发者部署。
核心观点提炼常规快讯,保留列表
正文内容概括Atomic Agent 发布了首个在基准测试中击败 Hermes 的本地代理,采用稳定前缀缓存和 TurboQuant 技术,在 GAIA Level 1 上完成 37 个任务。
核心观点提炼常规快讯,保留列表
正文内容概括ChatGPT Work 推出定时任务功能,可设置重复任务检查工具、创建简报等,帮助用户自动化工作流程。
核心观点提炼常规快讯,保留列表
正文内容概括SIMD(单指令多数据)常被认为复杂,但Mitchell Hashimoto通过Zig示例展示了其通用编程模式。文章以Ghostty终端中扫描控制字符为例,演示了五步法:广播常量、按向量宽度循环、并行比较、归约结果、标量尾部处理。该模式在ARM上实现4倍加速,Intel AVX2上8倍,AVX-512上16倍。作者强调编译器自动向量化有限,手动SIMD可预测且高效,鼓励开发者掌握这一技能。 核心观点: 1. SIMD通用模式包含5步:广播常量、按向量宽度循环、并行操作、归约结果、标量尾部处理。 2. 在Ghostty实际应用中,SIMD版本在AVX2上实现约5倍端到端加速。 3. 编译器自动向量化能力有限,手动SIMD可确保显式且可预测的优化。
核心观点提炼高信息密度,值得细读
正文内容概括Outtake 使用 Claude 和 Agent SDK 构建了自主网络调查员 Recon Agent,能够自主检测、调查和拆除数字威胁。
核心观点提炼常规快讯,保留列表
正文内容概括NVIDIA发布了Cosmos3 Edge模型,能理解视频流中的物理并推理,支持文字、图像和动作预测,可在边缘设备运行。
核心观点提炼常规快讯,保留列表
正文内容概括NVIDIA 发布了 Cosmos 3 Super 模型,支持4步生成图像和视频,速度提升25倍,在开放权重模型中排名领先。
核心观点提炼常规快讯,保留列表
正文内容概括谷歌向“创世纪使命”承诺4000万美元AI代金券和云积分,为美国能源部国家实验室提供前沿AI工具以加速科学发现。
核心观点提炼常规快讯,保留列表
正文内容概括multAIplayer 发布了 Alpha 版免费开源 macOS 应用和 CLI,让团队协作使用 Codex,共享会话与项目管理,提升 AI 辅助开发协作效率。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 为 Codex 和 ChatGPT Work 付费用户重置每日使用量,新额度一小时后生效。
核心观点提炼常规快讯,保留列表
本节暂无内容。
正文内容概括随着代码产量激增,代码审查成为瓶颈,尤其是隐性知识难以传达。OpenAI 为 Codex Code Review 推出 AGENTS.md 自定义规则功能,允许团队将审查规则写在代码旁,使 Codex 在审查时应用,将目标 finding 召回率从 58% 提升至 98%。开发者可通过编写规则捕获兼容性要求、数据边界等难以编码的“判断类”知识,从而提升审查质量和效率,规则是对测试和 linter 的补充。 核心观点: 1. 规则是对测试和 linter 的补充,用于承载难以编码的“判断类”知识,机械检查留给 CI。 2. 评测围绕覆盖、克制、保持、可操作性四个维度,其中克制和保持最易被忽视,宽泛指令易制造噪音。 3. 编写规则应从有后果且不显眼的不变量开始,作用域对齐代码,既说不变量也给安全路径,描述结果而非实现细节。
核心观点提炼高信息密度,值得细读
正文内容概括Claude Code团队在炉边对谈中分享系统提示词削减80%的经验。他们发现删除示例(few-shot examples)反而更好,因为当前模型比示例更有创造力;少用“不要做X”的禁令,多给上下文;检验每条指令是否100%成立,避免90%正确的指令导致误读。这些做法依赖Opus/Fable级别模型的判断力,对小模型仍需详细提示词。对开发者而言,提示词工程需从详细指令转向信任模型判断力,并重视评测。 核心观点: 1. 删除示例对Opus/Fable级模型更有效,模型比给定示例更有创造力。 2. 每条指令需检验是否100%成立,避免90%正确指令被误读。 3. 该方法依赖Opus/Fable级模型的判断力,小模型仍需详细提示词。
核心观点提炼高信息密度,值得细读
正文内容概括Kimi K3在AA-Briefcase基准测试中取得第二高分(Elo 1543),但每任务成本高达10.57美元,是前代Kimi K2.6的10倍。
核心观点提炼常规快讯,保留列表
正文内容概括知识猫图解 开源了故事转手绘视频 Skill,可将中文故事自动生成手绘日记动画,支持分镜、手写字幕和上色效果。
核心观点提炼常规快讯,保留列表
正文内容概括推理时扩展是提升LLM性能的重要方法,但掩码扩散语言模型(MDLM)通过随机性生成多样答案效果不佳。Sakana AI Labs提出UnMaskFork,通过多个MDLM协作和蒙特卡洛树搜索实现推理时扩展,在编码和数学任务上超越现有方法。该方法无需额外训练,可直接组合预训练模型提升性能,为MDLM的推理时扩展提供新方向。 核心观点: 1. UnMaskFork使用模型切换而非温度随机性产生多样性,通过MCTS探索最优协作顺序。 2. 在编码基准上一致优于现有推理时扩展方法,数学任务上随计算量稳步提升。
核心观点提炼高信息密度,值得细读
正文内容概括Fireworks AI 宣布支持在平台上训练 MiniMax M3 模型,提供托管 LoRA SFT/DPO 和自定义训练 API。
核心观点提炼常规快讯,保留列表
正文内容概括Cursor团队通过从零实现SQLite的实验,验证了Agent Swarm中上下文分工和模型组合的经济性。新harness显著优于旧:Grok 4.5新系统4小时达80%,旧系统不到2小时失控。架构为树形:强模型Planner拆分决策,便宜模型Worker执行。可扩展性来自上下文效率而非并行,协调成本是瓶颈。模型组合质量接近时成本差一个数量级($1,339 vs $20,057),优化策略是frontier仅用于高熵决策。实验还揭示了五类失败模式。对开发者:Harness设计、上下文分工和成本优化是关键。 核心观点: 1. 新harness在所有模型配置下更好,Grok 4.5新系统4小时约80%,旧系统不到2小时失控。 2. 不同模型mix质量接近,费用差极大:Opus planner+Composer worker成本$1,339,全程Fable $20,057。 3. 可扩展性主要来自上下文效率,planner不写实现、worker不规划,各自专注上下文。
核心观点提炼高信息密度,值得细读
正文内容概括ChatGPT 写作功能新增在写作前询问几个问题以理解上下文,减少来回沟通,生成更个性化草稿,提升写作效果。
核心观点提炼常规快讯,保留列表
正文内容概括Thinking Machines 的 Inkling 模型在 OpenRouter 上线,拥有 975B 总参数、41B 活跃参数、1M 上下文及多模态可控推理能力。
核心观点提炼常规快讯,保留列表
正文内容概括Thesean 发布了 Ship 端点,通过在模型名前加前缀实现固定 50% 成本降低,同时保持能力与行为,并公开 SLO 衡量质量。
核心观点提炼常规快讯,保留列表
摘要由 LLM 生成,请以原文为准。