精讲 1
产品Meng Shao @shao__meng本月精选58/100
正文内容概括Vercel Labs 开源 Native SDK,保留 Web 声明式 UI 体验,用自研引擎替代浏览器/WebView 直接绘制到 OS 窗口。基于 Zig 实现 Elm 架构,dev 模式热重载约2秒,release 模式编译时解析,二进制仅几 MB。内置 automation server 和 CLI agent skills,支持 AI 智能体读取 accessibility 快照、驱动 widget。开发者可用声明式范式构建高性能原生桌面应用,并集成 AI 自动化。
核心观点:
1. Native SDK 采用 Zig 实现 Elm 架构(Model/Msg/update/View),dev 模式热重载约2秒,release 模式 markup 编译进二进制,体积仅几 MB。
2. 自研引擎直接绘制到 OS 窗口,无浏览器/WebView,通过结构性 identity 和 keyed 列表确保跨重建状态稳定。
3. 内置 automation server,任何 agent 可读取 accessibility 快照、驱动 widget、断言状态,CLI 自带 agent skills。
核心观点提炼高信息密度,值得细读
产品原生桌面应用声明式UIZig热重载AI自动化
精讲 2
产品Cline @cline本月精选69/100
正文内容概括OpenAI 发布了 GPT-5.6 模型,在 Terminal-Bench 基准测试上达到 91.9% 的新纪录。该模型定价与 GPT-5.5 相同,为每百万 tokens 输入 5 美元、输出 30 美元。相比之下,Claude 的 Fable 模型被从订阅中移除并转向 API,成本更高(每百万 tokens 输入 10 美元、输出 50 美元)。这一发布对开发者意味着在保持成本不变的情况下获得了更强的终端任务性能。
核心观点:
1. GPT-5.6 在 Terminal-Bench 上达到 91.9%,创下新纪录。
2. GPT-5.6 定价与 GPT-5.5 相同,每百万 tokens 输入 5 美元、输出 30 美元。
3. Claude 的 Fable 模型 API 定价为每百万 tokens 输入 10 美元、输出 50 美元,是 GPT-5.6 的两倍。
核心观点提炼高信息密度,值得细读
产品GPT-5.6Terminal-Bench定价成本对比Claude
精讲 3
技术月之暗面 @Kimi_Moonshot本月精选72/100
正文内容概括Moonshot AI 开源了基于 CUTLASS 的高性能 Kimi Delta Attention 内核 FlashKDA,在 SM90+ GPU 上实现 1.72–2.22 倍 prefill 加速。该内核支持 bf16 输入、可变长度批处理,可无缝集成到 flash-linear-attention 库中,为开发者提供高效的注意力计算方案。
核心观点:
1. FlashKDA 在 prefill 阶段实现 1.72–2.22 倍加速(基于 H20 基准测试)。
2. 要求 SM90+ 架构、CUDA 12.9+ 和 PyTorch 2.4+。
3. 内核 API 要求 K=V=128,支持 bf16 输入和可变长度批处理。
核心观点提炼高信息密度,值得细读
技术FlashKDACUTLASSKimi Delta Attentionprefill加速开源
精讲 4
产品OpenAI Developers @OpenAIDevs本月精选71/100
正文内容概括OpenRouter 宣布 GPT-5.6 模型上线,提供 Sol、Terra 和 Luna 三种变体,早期测试显示其 token 效率更高、成本更低。
核心观点提炼常规快讯,保留列表
产品
精讲 5
产品Meng Shao @shao__meng本月精选67/100
正文内容概括Google 工程负责人 Addy Osmani 开源了 Agent Skills 项目,旨在解决 AI 编码智能体默认走捷径、产出不可靠代码的问题。该项目将资深工程师的生产级工程纪律固化为一个六阶段生命周期(DEFINE → PLAN → BUILD → VERIFY → REVIEW → SHIP)和 24 个可执行的技能,强制智能体遵循规格、测试、评审等流程。对开发者而言,这提供了一套可复用的工程化框架,能显著提升 AI 生成代码的质量与可靠性。
核心观点:
1. doubt-driven-development 技能通过 CLAIM → EXTRACT → DOUBT → RECONCILE → STOP 流程,针对高代价决策进行对抗性复盘,并支持跨模型升级。
2. source-driven-development 技能要求框架决策必须引用官方文档并标注未验证项,直接对抗 LLM 编造 API 的问题。
3. deprecation-and-migration 技能将代码视为负债,并配套强制与建议性弃用模式及僵尸代码清除机制。
核心观点提炼高信息密度,值得细读
产品AI Agent工程纪律工作流代码质量开源
精讲 6
产品宝玉 @dotey本月精选71/100
正文内容概括OpenAI 于6月26日发布 GPT-5.6 系列模型,包含旗舰级 Sol、日常级 Terra 和经济级 Luna。因美国政府要求,目前仅向约20家经审批的合作伙伴开放预览。Sol 新增 max 深度推理与 ultra 多子 Agent 并行模式,在 Terminal-Bench 2.1 上 Sol Ultra 得分 91.9%。Terra 性能接近上一代 GPT-5.5 但价格减半,Luna 主打低成本高吞吐。7月将上线 Cerebras 硬件加速版本,推理速度达每秒750 token。对开发者而言,Terra 的高性价比和 Sol 的 ultra 模式值得关注。
核心观点:
1. Sol Ultra 在 Terminal-Bench 2.1 上得分 91.9%,高于 Claude Mythos 5 的 88% 和 Gemini 3.1 Pro Preview 的 70.7%。
2. Sol 在 ExploitBench 上用约三分之一的 token 达到 Mythos Preview 的网络安全水平。
3. Sol 的 ultra 模式可调用多个子 Agent 并行处理复杂任务,无需开发者自行搭建 Agent 编排框架。
核心观点提炼高信息密度,值得细读
产品Agent多Agent协作推理模型安全评测API定价
精讲 7
产品OpenAI Blog本月精选77/100
正文内容概括OpenAI 预览了下一代模型 GPT-5.6 Sol,该模型在编程、科学和网络安全方面能力更强,并配备了最先进的安全栈。对开发者而言,这意味着更强的代码生成与科学推理能力,同时安全机制得到升级。
核心观点提炼重磅首发或硬核洞察
产品GPT-5.6 Sol编程科学网络安全安全栈
精讲 8
产品Anthropic Newsroom本月精选71/100
正文内容概括Anthropic 发布面向科学家的 AI 工作台 Claude Science(Beta),集成 60+ 预配置技能与数据库(如 UniProt、PDB、Ensembl),支持基因组学、蛋白质组学等科研任务。该平台将分散工具整合为统一环境,产出可审计、可复现的科研产物(含 3D 蛋白结构、化学结构等),并管理本地或云端计算资源(HPC、Modal)。对开发者/研究者而言,它降低了多工具切换与计算管理的复杂度,并支持通过 NVIDIA BioNeMo 连接生命科学模型。
核心观点:
1. Claude Science 内置 reviewer agent,可自动检查引用、计算错误并自我修正。
2. 平台支持 fork 会话以并行比较不同实验路径,且上下文在运行会话中持续保留。
3. 通过 NVIDIA BioNeMo Agent Toolkit 原生连接 Evo 2、Boltz-2、OpenFold3 等生命科学模型。
核心观点提炼高信息密度,值得细读
产品AI工作台科研自动化可复现性计算管理多智能体
精讲 9
产品Anthropic Newsroom本月精选70/100
正文内容概括Anthropic 推出 Claude Tag,一种在 Slack 中通过 @Claude 标签让团队协作使用 AI 的新方式。它支持多用户共享上下文、异步任务和主动提醒,管理员可精细控制工具和数据访问权限。目前以 beta 形式面向 Claude Enterprise 和 Team 客户开放,旨在将 Claude Code 的协作模式扩展到更广泛的团队场景。
核心观点:
1. Claude Tag 在 Slack 中实现多用户共享同一 Claude 实例,支持上下文记忆和异步任务。
2. Anthropic 内部产品团队 65% 的代码由内部版 Claude Tag 生成。
3. Claude Tag 基于 Opus 4.8 模型,支持管理员设置 token 限额和操作日志。
核心观点提炼高信息密度,值得细读
产品Slack团队协作多用户异步任务上下文记忆
精讲 10
产品Anthropic Newsroom本月精选75/100
正文内容概括Anthropic 发布 Claude Sonnet 5,定位为迄今最具智能体能力的 Sonnet 模型,在推理、工具使用和编码方面显著提升,性能接近 Opus 4.8 但价格更低。该模型已全面上线,成为 Free 和 Pro 计划的默认模型,并可通过 Claude API 使用。开发者可调整 effort 级别以平衡成本与性能,对构建复杂多步任务的智能体应用具有重要价值。
核心观点:
1. Sonnet 5 在 BrowseComp 和 OSWorld-Verified 等智能体评测中,通过调整 effort 级别可在部分任务上匹配 Opus 4.8 的性能。
2. Sonnet 5 引入新 tokenizer,输入 token 数约为之前的 1.0–1.35 倍,但通过定价调整实现大致成本中性。
3. Sonnet 5 的网络安全任务能力远低于当前 Opus 模型,整体不良行为率低于 Sonnet 4.6。
核心观点提炼重磅首发或硬核洞察
产品Agent推理工具调用编码成本优化
精讲 11
产品Anthropic Newsroom本月精选71/100
正文内容概括美国出口管制解除后,Anthropic 于 6 月 30 日宣布重新上线 Claude Fable 5 模型。此前因 Amazon 研究人员发现越狱方法,政府于 6 月 12 日实施管制。Anthropic 训练了新的安全分类器,在 99% 以上情况下阻止该越狱技术,并联合 Amazon、Microsoft、Google 等制定行业越狱评估框架。Fable 5 将于 7 月 1 日面向全球用户开放。
核心观点:
1. 新安全分类器在 99% 以上情况下阻止 Amazon 报告中的越狱技术。
2. Fable 5 的越狱行为仅涉及常规防御性网络安全工作,未暴露 Mythos 级别的独特网络能力。
3. Anthropic 联合 Amazon、Microsoft、Google 等开发行业统一的越狱严重性评估框架。
核心观点提炼高信息密度,值得细读
产品安全分类器越狱评估框架出口管制GlasswingClaude Fable 5
精讲 12
产品智谱AI @Zai_org本月精选70/100
正文内容概括Z.ai 发布了 GLM-5.2 开源模型,具备 1M 上下文窗口和两种推理模式(High 和 Max),专为智能体和长周期编码任务设计。该模型在编码和智能体任务上有显著改进,已上线 Venice 平台,对 Pro 用户完全私有可用。
核心观点:
1. GLM-5.2 提供两种推理模式:GLM-5.2 (max) 和 GLM-5.2 (high),分别对应极限推理和高效推理。
2. 模型支持 1M 上下文窗口,专为长周期智能体编码任务设计。
核心观点提炼高信息密度,值得细读
产品开源模型1M上下文窗口推理模式智能体编码
精讲 13
产品向阳乔木 @vista8本周精选60/100
正文内容概括vista8 发布了基于 bento PPT 改造的 Skill,可输入主题自动生成可编辑协作的 HTML PPT。
核心观点提炼常规快讯,保留列表
产品
精讲 14
产品OpenAI Blog本周精选72/100
正文内容概括OpenAI 宣布向10万名学术研究人员免费提供ChatGPT高级模型访问,以加速科学发现。
核心观点提炼常规快讯,保留列表
产品
精讲 15
技术宝玉 @dotey本周精选71/100
正文内容概括MCP协议发布重大版本,核心从有状态双向改为无状态请求/响应,每个请求独立携带版本和客户端信息,可负载到任意实例,使服务器能像HTTP服务部署,便于负载均衡和serverless。同时引入MRTR处理用户输入确认,请求头新增字段便于路由鉴权,授权加固。废弃部分功能但提供12个月过渡期。四个一级SDK同步更新,AWS、Microsoft、Cloudflare、Google Cloud等支持。开发者需评估迁移成本,但SDK团队已简化流程。
核心观点:
1. 协议改为无状态请求/响应,每个请求独立携带版本和客户端信息,可负载均衡,支持serverless部署。
2. MRTR允许服务端返回“需要输入”状态,客户端带用户回答重新请求,解决中途确认问题。
3. 请求头新增Mcp-Method和Mcp-Name,网关可直接根据请求头路由鉴权,无需解析JSON体。
核心观点提炼高信息密度,值得细读
技术MCP协议无状态负载均衡serverlessMRTR
精讲 16
讨论Anthropic Newsroom本周精选64/100
正文内容概括Anthropic CEO Dario Amodei 发文澄清公司不主张全面禁止开放权重模型,但支持对芯片出口、工业级蒸馏和强制安全测试进行管控,为AI政策讨论提供明确立场。
核心观点提炼常规快讯,保留列表
讨论
精讲 17
产品Chubby @kimmonismus本周精选67/100
正文内容概括月之暗面兑现承诺,正式开放Kimi k3模型权重,开发者可获取并使用该模型。
核心观点提炼常规快讯,保留列表
产品
精讲 18
产品Meng Shao @shao__meng本周精选63/100
正文内容概括移动端AI Agent开发面临系统集成和工具调用限制。OpenMinis发布开源AI Agent,在iOS和Android上通过Linux沙箱实现系统级集成:iOS使用iSH深度定制fork(ARM64 guest),Android使用PRoot。模型仅暴露8个核心工具,设备功能通过沙箱内CLI命令调用,采用Native Offloads机制降低token消耗。支持Skills兼容、记忆分层、权限控制等设计。为移动AI Agent开发提供新思路,降低开发门槛,提高模型可控性和效率。
核心观点:
1. iOS端用iSH深度定制fork(OpenMinis/ish-arm64),改造为ARM64 guest,配合Asbestos JIT解释器,实现进程管理和100+系统调用。
2. 模型仅见8个工具(shell_execute等),20+设备集成通过沙箱CLI命令,Native Offloads将execve()路由到宿主侧原生handler。
3. Agent循环最多200轮,并发工具执行上限10,分级自动压缩与上下文卸载,并设有ToolLoopDetector熔断器。
核心观点提炼高信息密度,值得细读
产品Agent移动端Linux沙箱iOSAndroid
精讲 19
技巧Meng Shao @shao__meng本周精选62/100
正文内容概括Claude Design作者Nate Parrott分享了十条使用AI设计工具的最佳实践,涵盖prompt技巧、设计系统、迭代方法等,帮助用户提升设计效率。
核心观点提炼常规快讯,保留列表
技巧
精讲 20
产品OpenAI @OpenAI本周精选65/100
正文内容概括OpenAI 发布新一代语音模型 GPT-Live,在 ChatGPT 中向教育、商业和企业计划全球推出,实现更自然的人机交互。
核心观点提炼常规快讯,保留列表
产品
精讲 21
产品Sam Altman @sama本周精选70/100
正文内容概括OpenAI 发布了 ChatGPT Voice 桌面应用功能,支持语音控制计算机和指挥多个 agent,由 GPT-Live 驱动,提升交互效率。
核心观点提炼常规快讯,保留列表
产品
精讲 22
产品月之暗面 @Kimi_Moonshot本周精选64/100
正文内容概括Kimi_Moonshot 发布 Kimi K3 模型,在 3D Design Arena 中以 Elo 1450 排名第一,较前代 Kimi K2.6 提升 108 Elo。
核心观点提炼常规快讯,保留列表
产品
精讲 23
产品Claude Blog本周精选69/100
正文内容概括在代理编码会话中,验证是代理检查工作的关键环节。Anthropic介绍了在Claude Code中构建验证循环的方法,包括内置的/verify skill、toolchain、code review等,以及如何将手动检查步骤编码为技能,实现自动化验证。这有助于开发者提升编码代理的迭代效率,减少手动干预。
核心观点:
1. Claude Code内置/verify skill、toolchain、code review等多种验证循环,可自动捕获错误。
2. 自定义验证循环需将手动检查步骤编码为技能,例如拒绝没有回填步骤的列迁移。
3. 使用CLAUDE.md列出精确的构建和测试命令,避免Claude推断。
核心观点提炼高信息密度,值得细读
产品Claude Code验证循环技能自动化编码代理
精讲 24
讨论Anthropic Newsroom本周精选67/100
正文内容概括Anthropic 发布了经济未来研究基金议程,承诺投入2亿美元支持AI经济影响的外部研究,旨在为政策制定提供实证依据。
核心观点提炼常规快讯,保留列表
讨论
精讲 25
产品OpenAI @OpenAI本周精选65/100
正文内容概括OpenAI 展示 GPT-Live 模型改进智能,可同时处理查航班、查天气和制定行程等多任务,保持对话连贯。
核心观点提炼常规快讯,保留列表
产品
精讲 26
产品Meng Shao @shao__meng本周精选65/100
正文内容概括随着代码产量激增,代码审查成为瓶颈,尤其是隐性知识难以传达。OpenAI 为 Codex Code Review 推出 AGENTS.md 自定义规则功能,允许团队将审查规则写在代码旁,使 Codex 在审查时应用,将目标 finding 召回率从 58% 提升至 98%。开发者可通过编写规则捕获兼容性要求、数据边界等难以编码的“判断类”知识,从而提升审查质量和效率,规则是对测试和 linter 的补充。
核心观点:
1. 规则是对测试和 linter 的补充,用于承载难以编码的“判断类”知识,机械检查留给 CI。
2. 评测围绕覆盖、克制、保持、可操作性四个维度,其中克制和保持最易被忽视,宽泛指令易制造噪音。
3. 编写规则应从有后果且不显眼的不变量开始,作用域对齐代码,既说不变量也给安全路径,描述结果而非实现细节。
核心观点提炼高信息密度,值得细读
产品Code Review自定义规则召回率方法论隐性知识
精讲 27
技巧Meng Shao @shao__meng本周精选68/100
正文内容概括Claude Code团队在炉边对谈中分享系统提示词削减80%的经验。他们发现删除示例(few-shot examples)反而更好,因为当前模型比示例更有创造力;少用“不要做X”的禁令,多给上下文;检验每条指令是否100%成立,避免90%正确的指令导致误读。这些做法依赖Opus/Fable级别模型的判断力,对小模型仍需详细提示词。对开发者而言,提示词工程需从详细指令转向信任模型判断力,并重视评测。
核心观点:
1. 删除示例对Opus/Fable级模型更有效,模型比给定示例更有创造力。
2. 每条指令需检验是否100%成立,避免90%正确指令被误读。
3. 该方法依赖Opus/Fable级模型的判断力,小模型仍需详细提示词。
核心观点提炼高信息密度,值得细读
技巧系统提示词提示词工程Claude Code模型判断力评测
精讲 28
产品Anthropic Newsroom本周精选64/100
正文内容概括Anthropic 发布了针对罕见遗传病的 AI for Science 资助计划,提供最高 5 万美元 Claude 积分,旨在加速基础科学和生物技术研究。
核心观点提炼常规快讯,保留列表
产品
精讲 29
产品月之暗面 @Kimi_Moonshot本周精选65/100
正文内容概括Kimi K3 在 Vals AI 的 Vibe Code Bench 上以 85.0% 得分排名第二,该基准测试模型从零创建完整 Web 应用的能力。
核心观点提炼常规快讯,保留列表
产品
精讲 30
产品月之暗面 @Kimi_Moonshot本周精选65/100
正文内容概括Kimi 因 K3 模型需求超预期,暂停新订阅并优先保障现有用户,同时计划拆分会员为通用和代码两个版本。
核心观点提炼常规快讯,保留列表
产品