ChatGPT 现已支持构建和发布完整 Web 应用,并附有教程视频演示
正文内容概括ChatGPT 现已支持构建和发布完整 Web 应用,并附有教程视频演示。
今天这期 AIWatch 早报围绕「product、Claude Code、SIMD」展开,先用一段导语把当天主线收束起来,再按今日头条、推荐精选和补充速览逐条介绍。聚焦 2 · 关注 0 · 跟进 10。
如果只有 20 分钟,先读:ChatGPT 现已支持构建和发布完整 Web 应用,并附有教程视频演示 → 腾讯混元发布了Hy3模型的GGUF量化版本,支持llama.cpp直接运行和MTP自推测解码,方便开发者部署 → Anthropic 介绍了在 Claude Code 中构建验证循环的技能方法,帮助开发者将手动检查步骤自动化,提升编码代理的迭代效率。
今天的主线不是孤立新闻,而是「product、Claude Code、SIMD」在不同层面的同步推进。
正文内容概括ChatGPT 现已支持构建和发布完整 Web 应用,并附有教程视频演示。
核心观点提炼常规快讯,保留列表
正文内容概括腾讯混元发布了Hy3模型的GGUF量化版本,支持llama.cpp直接运行和MTP自推测解码,方便开发者部署。
核心观点提炼常规快讯,保留列表
本节暂无内容。
正文内容概括在代理编码会话中,验证是代理检查工作的关键环节。Anthropic介绍了在Claude Code中构建验证循环的方法,包括内置的/verify skill、toolchain、code review等,以及如何将手动检查步骤编码为技能,实现自动化验证。这有助于开发者提升编码代理的迭代效率,减少手动干预。 核心观点: 1. Claude Code内置/verify skill、toolchain、code review等多种验证循环,可自动捕获错误。 2. 自定义验证循环需将手动检查步骤编码为技能,例如拒绝没有回填步骤的列迁移。 3. 使用CLAUDE.md列出精确的构建和测试命令,避免Claude推断。
核心观点提炼高信息密度,值得细读
正文内容概括Anthropic 发布了经济未来研究基金议程,承诺投入2亿美元支持AI经济影响的外部研究,旨在为政策制定提供实证依据。
核心观点提炼常规快讯,保留列表
正文内容概括OpenAI 展示 GPT-Live 模型改进智能,可同时处理查航班、查天气和制定行程等多任务,保持对话连贯。
核心观点提炼常规快讯,保留列表
正文内容概括随着代码产量激增,代码审查成为瓶颈,尤其是隐性知识难以传达。OpenAI 为 Codex Code Review 推出 AGENTS.md 自定义规则功能,允许团队将审查规则写在代码旁,使 Codex 在审查时应用,将目标 finding 召回率从 58% 提升至 98%。开发者可通过编写规则捕获兼容性要求、数据边界等难以编码的“判断类”知识,从而提升审查质量和效率,规则是对测试和 linter 的补充。 核心观点: 1. 规则是对测试和 linter 的补充,用于承载难以编码的“判断类”知识,机械检查留给 CI。 2. 评测围绕覆盖、克制、保持、可操作性四个维度,其中克制和保持最易被忽视,宽泛指令易制造噪音。 3. 编写规则应从有后果且不显眼的不变量开始,作用域对齐代码,既说不变量也给安全路径,描述结果而非实现细节。
核心观点提炼高信息密度,值得细读
正文内容概括Claude Code团队在炉边对谈中分享系统提示词削减80%的经验。他们发现删除示例(few-shot examples)反而更好,因为当前模型比示例更有创造力;少用“不要做X”的禁令,多给上下文;检验每条指令是否100%成立,避免90%正确的指令导致误读。这些做法依赖Opus/Fable级别模型的判断力,对小模型仍需详细提示词。对开发者而言,提示词工程需从详细指令转向信任模型判断力,并重视评测。 核心观点: 1. 删除示例对Opus/Fable级模型更有效,模型比给定示例更有创造力。 2. 每条指令需检验是否100%成立,避免90%正确指令被误读。 3. 该方法依赖Opus/Fable级模型的判断力,小模型仍需详细提示词。
核心观点提炼高信息密度,值得细读
正文内容概括Atomic Agent 发布了首个在基准测试中击败 Hermes 的本地代理,采用稳定前缀缓存和 TurboQuant 技术,在 GAIA Level 1 上完成 37 个任务。
核心观点提炼常规快讯,保留列表
正文内容概括ChatGPT Work 推出定时任务功能,可设置重复任务检查工具、创建简报等,帮助用户自动化工作流程。
核心观点提炼常规快讯,保留列表
正文内容概括SIMD(单指令多数据)常被认为复杂,但Mitchell Hashimoto通过Zig示例展示了其通用编程模式。文章以Ghostty终端中扫描控制字符为例,演示了五步法:广播常量、按向量宽度循环、并行比较、归约结果、标量尾部处理。该模式在ARM上实现4倍加速,Intel AVX2上8倍,AVX-512上16倍。作者强调编译器自动向量化有限,手动SIMD可预测且高效,鼓励开发者掌握这一技能。 核心观点: 1. SIMD通用模式包含5步:广播常量、按向量宽度循环、并行操作、归约结果、标量尾部处理。 2. 在Ghostty实际应用中,SIMD版本在AVX2上实现约5倍端到端加速。 3. 编译器自动向量化能力有限,手动SIMD可确保显式且可预测的优化。
核心观点提炼高信息密度,值得细读
正文内容概括Outtake 使用 Claude 和 Agent SDK 构建了自主网络调查员 Recon Agent,能够自主检测、调查和拆除数字威胁。
核心观点提炼常规快讯,保留列表
正文内容概括NVIDIA发布了Cosmos3 Edge模型,能理解视频流中的物理并推理,支持文字、图像和动作预测,可在边缘设备运行。
核心观点提炼常规快讯,保留列表
摘要由 LLM 生成,请以原文为准。