在代理编码会话中,验证是代理检查工作的关键环节。Anthropic介绍了在Claude Code中构建验证循环的方法,包括内置的/verify skill、toolchain、code review等,以及如何将手动检查步骤编码为技能,实现自动化验证。这有助于开发者提升编码代理的迭代效率,减少手动干预。 核心观点: 1. Claude Code内置/verify skill、toolchain、code review等多种验证循环,可自动捕获错误。 2. 自定义验证循环需将手动检查步骤编码为技能,例如拒绝没有回填步骤的列迁移。 3. 使用CLAUDE.md列出精确的构建和测试命令,避免Claude推断。
Claude Code团队在炉边对谈中分享系统提示词削减80%的经验。他们发现删除示例(few-shot examples)反而更好,因为当前模型比示例更有创造力;少用“不要做X”的禁令,多给上下文;检验每条指令是否100%成立,避免90%正确的指令导致误读。这些做法依赖Opus/Fable级别模型的判断力,对小模型仍需详细提示词。对开发者而言,提示词工程需从详细指令转向信任模型判断力,并重视评测。 核心观点: 1. 删除示例对Opus/Fable级模型更有效,模型比给定示例更有创造力。 2. 每条指令需检验是否100%成立,避免90%正确指令被误读。 3. 该方法依赖Opus/Fable级模型的判断力,小模型仍需详细提示词。
Armin Ronacher 发现新版 Claude 模型(Opus 4.8、Sonnet 5)在调用 Pi 编辑工具时,会在嵌套的 edits[] 数组中凭空捏造 schema 中不存在的字段(如 requireUnique、oldText2、type 等),导致工具调用被拒绝。尽管实际编辑内容正确,但模型会添加多余键值。该问题在旧版模型中不存在,且与上下文相关:在智能体历史对话中复现率约 20%,去掉 thinking blocks 后减半,开启严格工具调用后消失。Ronacher 推测这是后训练阶段针对 Claude Code 生态优化的副作用——Claude Code 的客户端会容忍并修复格式错误,导致模型学会在宽松环境下产生“格式垃圾”。这对开发者意味着:若工具 schema 与 Claude Code 不一致,新版模型可能更不忠实于格式,需要更严格的约束解码或工具调用验证。 核心观点: 1. Opus 4.8 和 Sonnet 5 在 Pi 编辑工具调用中会凭空添加 schema 中不存在的键(如 requireUnique、oldText2、type、id、kind 等),而旧版模型无此问题。 2. 该问题在智能体多轮对话中复现率约 20%,去掉 thinking blocks 后减半,开启严格工具调用后完全消失。 3. Ronacher 推测后训练阶段针对 Claude Code 的宽松工具调用生态(自动修复格式错误)是导致模型产生格式垃圾的根本原因。