精讲 1
产品宝玉 @dotey本月精选71/100
正文内容概括OpenAI 于6月26日发布 GPT-5.6 系列模型,包含旗舰级 Sol、日常级 Terra 和经济级 Luna。因美国政府要求,目前仅向约20家经审批的合作伙伴开放预览。Sol 新增 max 深度推理与 ultra 多子 Agent 并行模式,在 Terminal-Bench 2.1 上 Sol Ultra 得分 91.9%。Terra 性能接近上一代 GPT-5.5 但价格减半,Luna 主打低成本高吞吐。7月将上线 Cerebras 硬件加速版本,推理速度达每秒750 token。对开发者而言,Terra 的高性价比和 Sol 的 ultra 模式值得关注。
核心观点:
1. Sol Ultra 在 Terminal-Bench 2.1 上得分 91.9%,高于 Claude Mythos 5 的 88% 和 Gemini 3.1 Pro Preview 的 70.7%。
2. Sol 在 ExploitBench 上用约三分之一的 token 达到 Mythos Preview 的网络安全水平。
3. Sol 的 ultra 模式可调用多个子 Agent 并行处理复杂任务,无需开发者自行搭建 Agent 编排框架。
核心观点提炼高信息密度,值得细读
产品Agent多Agent协作推理模型安全评测API定价
精讲 2
产品OpenAI Blog本月精选77/100
正文内容概括OpenAI 预览了下一代模型 GPT-5.6 Sol,该模型在编程、科学和网络安全方面能力更强,并配备了最先进的安全栈。对开发者而言,这意味着更强的代码生成与科学推理能力,同时安全机制得到升级。
核心观点提炼重磅首发或硬核洞察
产品GPT-5.6 Sol编程科学网络安全安全栈
精讲 3
产品Anthropic Newsroom本月精选71/100
正文内容概括Anthropic 发布面向科学家的 AI 工作台 Claude Science(Beta),集成 60+ 预配置技能与数据库(如 UniProt、PDB、Ensembl),支持基因组学、蛋白质组学等科研任务。该平台将分散工具整合为统一环境,产出可审计、可复现的科研产物(含 3D 蛋白结构、化学结构等),并管理本地或云端计算资源(HPC、Modal)。对开发者/研究者而言,它降低了多工具切换与计算管理的复杂度,并支持通过 NVIDIA BioNeMo 连接生命科学模型。
核心观点:
1. Claude Science 内置 reviewer agent,可自动检查引用、计算错误并自我修正。
2. 平台支持 fork 会话以并行比较不同实验路径,且上下文在运行会话中持续保留。
3. 通过 NVIDIA BioNeMo Agent Toolkit 原生连接 Evo 2、Boltz-2、OpenFold3 等生命科学模型。
核心观点提炼高信息密度,值得细读
产品AI工作台科研自动化可复现性计算管理多智能体
精讲 4
产品Anthropic Newsroom本月精选70/100
正文内容概括Anthropic 推出 Claude Tag,一种在 Slack 中通过 @Claude 标签让团队协作使用 AI 的新方式。它支持多用户共享上下文、异步任务和主动提醒,管理员可精细控制工具和数据访问权限。目前以 beta 形式面向 Claude Enterprise 和 Team 客户开放,旨在将 Claude Code 的协作模式扩展到更广泛的团队场景。
核心观点:
1. Claude Tag 在 Slack 中实现多用户共享同一 Claude 实例,支持上下文记忆和异步任务。
2. Anthropic 内部产品团队 65% 的代码由内部版 Claude Tag 生成。
3. Claude Tag 基于 Opus 4.8 模型,支持管理员设置 token 限额和操作日志。
核心观点提炼高信息密度,值得细读
产品Slack团队协作多用户异步任务上下文记忆
精讲 5
产品Anthropic Newsroom本月精选75/100
正文内容概括Anthropic 发布 Claude Sonnet 5,定位为迄今最具智能体能力的 Sonnet 模型,在推理、工具使用和编码方面显著提升,性能接近 Opus 4.8 但价格更低。该模型已全面上线,成为 Free 和 Pro 计划的默认模型,并可通过 Claude API 使用。开发者可调整 effort 级别以平衡成本与性能,对构建复杂多步任务的智能体应用具有重要价值。
核心观点:
1. Sonnet 5 在 BrowseComp 和 OSWorld-Verified 等智能体评测中,通过调整 effort 级别可在部分任务上匹配 Opus 4.8 的性能。
2. Sonnet 5 引入新 tokenizer,输入 token 数约为之前的 1.0–1.35 倍,但通过定价调整实现大致成本中性。
3. Sonnet 5 的网络安全任务能力远低于当前 Opus 模型,整体不良行为率低于 Sonnet 4.6。
核心观点提炼重磅首发或硬核洞察
产品Agent推理工具调用编码成本优化
精讲 6
产品Anthropic Newsroom本月精选71/100
正文内容概括美国出口管制解除后,Anthropic 于 6 月 30 日宣布重新上线 Claude Fable 5 模型。此前因 Amazon 研究人员发现越狱方法,政府于 6 月 12 日实施管制。Anthropic 训练了新的安全分类器,在 99% 以上情况下阻止该越狱技术,并联合 Amazon、Microsoft、Google 等制定行业越狱评估框架。Fable 5 将于 7 月 1 日面向全球用户开放。
核心观点:
1. 新安全分类器在 99% 以上情况下阻止 Amazon 报告中的越狱技术。
2. Fable 5 的越狱行为仅涉及常规防御性网络安全工作,未暴露 Mythos 级别的独特网络能力。
3. Anthropic 联合 Amazon、Microsoft、Google 等开发行业统一的越狱严重性评估框架。
核心观点提炼高信息密度,值得细读
产品安全分类器越狱评估框架出口管制GlasswingClaude Fable 5
精讲 7
产品智谱AI @Zai_org本月精选70/100
正文内容概括Z.ai 发布了 GLM-5.2 开源模型,具备 1M 上下文窗口和两种推理模式(High 和 Max),专为智能体和长周期编码任务设计。该模型在编码和智能体任务上有显著改进,已上线 Venice 平台,对 Pro 用户完全私有可用。
核心观点:
1. GLM-5.2 提供两种推理模式:GLM-5.2 (max) 和 GLM-5.2 (high),分别对应极限推理和高效推理。
2. 模型支持 1M 上下文窗口,专为长周期智能体编码任务设计。
核心观点提炼高信息密度,值得细读
产品开源模型1M上下文窗口推理模式智能体编码
精讲 8
产品OpenAI @OpenAI本月精选68/100
正文内容概括OpenAI 收购 Ona,为 Codex 智能体构建持久化安全云工作空间,解决复杂任务无人值守时中断的问题。Ona 提供受控环境,使智能体能运行命令、保存上下文并在笔记本关闭后恢复工作,满足企业级安全需求。此举将 Codex 从对话工具扩展为可执行测试、修复、重构等长时任务的托管执行层,为开发者提供更可靠的自动化基础设施。
核心观点:
1. Codex 周活用户已达 500 万,增长 400%,显示智能体需求快速扩张。
2. Ona 提供持久化云工作空间,使智能体能在笔记本关闭后继续运行命令并恢复上下文。
3. 收购目标为企业场景:支持在自有云边界内部署智能体,提供限定凭证、审查跟踪与可审计活动。
核心观点提炼高信息密度,值得细读
产品智能体企业安全云执行环境DevOps自动化运维
精讲 9
产品Google AI @GoogleAI本月精选74/100
正文内容概括Google 本周密集发布多款 AI 产品。Gemma 4 12B 作为统一的 encoder-free 多模态模型,支持笔记本端完全离线运行,并通过 Quantization-Aware Training (QAT) 降低内存占用;Nano Banana 2 与 Nano Banana Pro 企业智能体平台正式商用;Co-Scientist 科研多智能体系统可生成并优化科学假设;Magenta RealTime 2 开放权重实时音乐模型支持 MIDI 与手势交互。对开发者而言,端侧部署与企业智能体工具链得到显著增强。
核心观点:
1. Gemma 4 12B 采用 encoder-free 架构,支持笔记本完全离线运行多模态任务。
2. Gemma 4 及其 drafters 经 Quantization-Aware Training (QAT) 优化,可降低内存需求并最大化端侧性能。
3. Magenta RealTime 2 为开放权重实时音乐模型,支持通过 MIDI 键盘、文本提示和手势进行演奏交互。
核心观点提炼重磅首发或硬核洞察
产品端侧推理多模态智能体开放权重QAT
精讲 10
产品MiniMax @MiniMax_AI本月精选73/100
正文内容概括MiniMax 宣布开源高性能 MSA kernel 库,并预告 M3 模型权重将于本周五发布。MSA 库为稀疏注意力提供底层高性能实现,开发者可通过 GitHub 获取代码与论文。此举降低了稀疏注意力优化门槛,同时 M3 开放权重将让研究者能够本地部署该模型进行后续研究与开发。
核心观点提炼高信息密度,值得细读
产品稀疏注意力开放权重Kernel优化注意力机制MiniMax
精讲 11
产品MiniMax @MiniMax_AI本月精选74/100
正文内容概括MiniMax 发布开放权重模型 MiniMax M3。该模型总参数量约 428B、激活参数量约 23B,支持 1M-token 上下文窗口与原生多模态理解,并具备前沿编码与 Agent 能力。模型权重已上架 Hugging Face,同时发布了 MiniMax Sparse Attention 论文。开发者可直接下载部署,在超长上下文、多模态及 Agent 场景中进行应用开发与评测。
核心观点:
1. MiniMax M3 总参数量约 428B,激活参数量约 23B,以开放权重形式发布。
2. 模型支持 1M-token 上下文窗口,具备原生多模态理解及前沿编码与 Agent 能力。
3. 权重已上架 Hugging Face,并配套发布 MiniMax Sparse Attention 技术论文。
核心观点提炼高信息密度,值得细读
产品Agent多模态长上下文稀疏注意力开放权重
精讲 12
产品Anthropic @AnthropicAI本月精选73/100
正文内容概括美国政府以国家安全为由发布出口管制指令,要求暂停所有外国国民(包括外国籍员工)对 Anthropic 的 Fable 5 和 Mythos 5 模型的访问。Anthropic 被迫立即对所有客户禁用这两个模型,其他 Claude 模型不受影响。公司认为这是误解,正努力恢复访问。
核心观点:
1. 美国政府出口管制指令要求暂停所有外国国民对 Fable 5 和 Mythos 5 的访问,包括 Anthropic 的外国籍员工。
2. Anthropic 被迫立即对所有客户禁用 Fable 5 和 Mythos 5,其他 Claude 模型不受影响。
核心观点提炼高信息密度,值得细读
产品出口管制国家安全模型访问限制美国政府
精讲 13
产品智谱AI @Zai_org本月精选73/100
正文内容概括智谱AI在ModelScope发布GLM-5.2模型,支持100万上下文窗口,并显著提升编码能力。该模型在Code Arena全球可用模型中排名第二,在FrontierSWE、SWE-Marathon和PostTrainBench等基准上成为排名最高的开源模型,性能介于Claude Opus 4.7和4.8之间。GLM-5.2采用KV8、LayerSplit、IndexShare等技术实现百万上下文,在Terminal-Bench 2.1上达到开源SOTA,较GLM-5.1提升17.5%。开发者可使用vLLM、SGLang、Transformers进行推理部署。
核心观点:
1. GLM-5.2在Code Arena全球所有可用模型中排名第二。
2. 在Terminal-Bench 2.1上达到开源SOTA,较GLM-5.1提升17.5%。
3. 采用KV8、LayerSplit、IndexShare技术实现100万上下文窗口。
核心观点提炼高信息密度,值得细读
产品开源模型编码能力百万上下文基准测试推理部署
精讲 14
产品智谱AI @Zai_org本月精选70/100
正文内容概括智谱AI发布GLM-5.2模型,在移动应用开发能力上实现大幅提升。内部基准测试包含35个挑战性移动开发任务,每个任务运行两次共70次试验,以核心功能无重大问题为完成标准。GLM-5.2完成率从GLM-5.1的21/70提升至48/70,提升超过两倍,但仍低于Claude Fable 5的56/70。对开发者而言,该模型在长周期任务上的进步值得关注。
核心观点:
1. GLM-5.2在内部移动开发基准测试中完成率从21/70提升至48/70,提升超过两倍。
2. 基准测试包含35个挑战性移动开发任务,每个任务运行两次共70次试验。
3. Claude Fable 5在该基准上完成率为56/70,高于GLM-5.2。
核心观点提炼高信息密度,值得细读
产品移动应用开发基准测试模型升级长周期任务
精讲 15
技巧Claude Blog本周精选64/100
正文内容概括Claude Code 团队定义了编码代理中循环的概念,将其分类为基于触发、停止、原语和任务类型的多种模式,并建议从简单方案开始。
核心观点提炼常规快讯,保留列表
技巧
精讲 16
产品Simon Willison本周精选66/100
正文内容概括Current AI 发布了开源 AI 差距地图 v0.1,索引了 421 个开源 AI 产品及 24400 个未分类工件,数据以 MIT 许可在 GitHub 开放。
核心观点提炼常规快讯,保留列表
产品
精讲 17
产品Boris Cherny @bcherny本周精选62/100
正文内容概括Anthropic 的 Claude 模型在微软 Foundry 平台正式上线,Azure 用户可使用 Claude Opus 4.8 和 Haiku 4.5,并集成 Azure 认证与计费。
核心观点提炼常规快讯,保留列表
产品
精讲 18
产品Anthropic @AnthropicAI本周精选69/100
正文内容概括Anthropic 宣布美国商务部已解除对 Claude Fable 5 和 Mythos 5 的出口管制,将于次日恢复访问。此举对依赖这些模型的开发者意味着服务中断结束,可重新使用相关能力。
核心观点提炼高信息密度,值得细读
产品出口管制模型恢复Anthropic
精讲 19
产品宝玉 @dotey本周精选62/100
正文内容概括Anthropic 恢复上线 Fable 5 模型,调整使用配额和计费方式,并增加安全分类器以限制网络安全任务。
核心观点提炼常规快讯,保留列表
产品
精讲 20
产品OpenAI Blog本周精选66/100
正文内容概括OpenAI 发布了 GeneBench-Pro 基准测试,用于评估 AI 在基因组学、生物学和科学研究中的性能。
核心观点提炼常规快讯,保留列表
产品
精讲 21
产品Claude Blog本周精选65/100
正文内容概括Anthropic 宣布 Claude 模型在 Microsoft Foundry 上正式可用,托管于 Azure 并提供数据驻留选项。
核心观点提炼常规快讯,保留列表
产品
精讲 22
技术Anthropic Newsroom本周精选71/100
正文内容概括Anthropic 重新部署 Claude Fable 5 后,公开了其网络安全分类器的详细设计,将网络安全使用分为禁止、高风险双用途、低风险双用途和良性四类,并设置了更大的安全裕度以减少有害输出。同时,Anthropic 与 Glasswing 合作提出了 AI 越狱严重性框架草案(CJS 0-4),基于能力增益、广度、易用性和可发现性四个维度评分,旨在建立行业标准。此举为开发者提供了更透明的安全机制,并推动学术界、工业界和政府间的讨论。
核心观点:
1. Fable 5 的安全裕度比前代模型更大,导致更多良性请求被误拦,但提高了防止有害输出的信心。
2. 越狱严重性框架 CJS 0-4 基于能力增益、广度、易用性和可发现性四个维度评分,Log4Shell 案例展示了从 CJS-4 到 CJS-0 的评分变化。
核心观点提炼高信息密度,值得细读
技术网络安全安全分类器越狱严重性框架CJS安全裕度
精讲 23
技术OpenAI Blog本周精选63/100
正文内容概括OpenAI 工程师通过大规模核心转储分析,对罕见的基础设施崩溃进行调试,最终发现了一个硬件故障和一个存在18年的软件漏洞。这一发现对开发者意味着,核心转储分析在排查复杂系统问题时仍具有重要价值,同时也提醒关注长期存在的软件缺陷。
核心观点:
1. 核心转储分析成功定位了硬件故障和存在18年的软件漏洞。
核心观点提炼高信息密度,值得细读
技术核心转储分析基础设施崩溃硬件故障软件漏洞
精讲 24
产品OpenRouter @OpenRouter本周精选65/100
正文内容概括OpenRouter 发布了 MCP 服务,让智能体根据实时基准、定价和用量数据自动选择模型,避免盲目使用固定模型。
核心观点提炼常规快讯,保留列表
产品
精讲 25
技巧宝玉 @dotey本周精选67/100
正文内容概括针对多微服务场景下AI Agent进行系统设计与编码的实践方案。核心挑战在于Agent需理解多个微服务的职责边界与业务概念。推荐采用monorepo或虚拟monorepo提供全局视图,配合分层文档(根目录AGENTS.md索引+各服务目录职责文档)实现按需加载上下文。强调利用OpenAPI spec、Pact契约文件等机器可读规格及协议测试代码作为精准上下文来源。验证方面,通过mock server和contract test形成“写代码→跑测试→自我修正”的闭环,避免依赖完整集成环境。
核心观点:
1. monorepo或虚拟monorepo(多仓库clone到同一本地目录)是社区推荐的Agent上下文组织方式。
2. 分层文档策略:根目录AGENTS.md做索引,各微服务目录内放职责与业务概念文档(DDD bounded context)。
3. 协议测试代码(如Pact契约文件)是比手写文档更准确的活文档,因测试失败即表明协议不一致。
核心观点提炼高信息密度,值得细读
技巧Agent微服务monorepo上下文工程契约测试
精讲 26
产品Google DeepMind Blog本周精选73/100
正文内容概括谷歌在 Gemini 3.5 Flash 模型中引入了计算机使用能力,使模型能够直接操控桌面应用和浏览器。这一功能拓展了多模态交互的边界,允许开发者构建能够像人类一样操作界面的智能体应用。对开发者而言,这意味着可以基于该能力开发自动化工作流、测试脚本或辅助工具,但需注意模型在复杂界面中的稳定性和安全性。
核心观点:
1. Gemini 3.5 Flash 新增计算机使用能力,可直接操控桌面应用和浏览器。
2. 该能力拓展了多模态交互边界,支持开发者构建自动化界面操作智能体。
核心观点提炼重磅首发或硬核洞察
产品计算机使用多模态交互自动化智能体浏览器操控
精讲 27
产品Claude Blog本周精选67/100
正文内容概括Anthropic 发布了 Claude 应用网关,支持 Amazon Bedrock 和 Google Cloud,提供企业 SSO、集中策略和成本归属功能。
核心观点提炼常规快讯,保留列表
产品
精讲 28
产品Google DeepMind @GoogleDeepMind本周精选71/100
正文内容概括谷歌DeepMind发布Gemini 3.5 Flash,新增原生计算机使用能力。该内置工具允许开发者构建可跨浏览器、移动和桌面界面进行视觉识别与操作的智能体,扩展了AI在自动化交互场景的应用边界。
核心观点:
1. Gemini 3.5 Flash新增原生计算机使用工具,支持开发者构建跨浏览器、移动和桌面界面的智能体。
核心观点提炼高信息密度,值得细读
产品Agent计算机使用跨平台自动化
精讲 29
技巧宝玉 @dotey本周精选67/100
正文内容概括开源电子书《Claude Code From Scratch》通过约4300行代码(TypeScript和Python两个版本)复现了Claude Code的核心架构,包括Agent Loop、13个工具(支持并行执行和流式早期启动)、4层上下文压缩、语义记忆召回、技能系统、多Agent和MCP集成。全书13章,每章为分步教程,对照真实源码讲解简化实现,帮助开发者理解coding agent的工作原理。
核心观点:
1. 用约4300行代码复现Claude Code核心架构,包括Agent Loop、13个工具、4层上下文压缩等。
2. 提供TypeScript和Python两个版本,每章对照真实源码讲解简化实现。
核心观点提炼高信息密度,值得细读
技巧Agent开源电子书TypeScriptPython上下文压缩
精讲 30
产品Anthropic @AnthropicAI本周精选72/100
正文内容概括Anthropic 发布了 Claude Sonnet 5,这是其最具智能体能力的 Sonnet 模型。该模型能够自主制定计划,并使用浏览器和终端等工具,其自主运行水平接近数月前需要更大、更昂贵模型才能达到的程度。这对开发者意味着可以以更低成本实现更复杂的自动化任务。
核心观点:
1. Claude Sonnet 5 具备自主规划能力,并能使用浏览器和终端等工具。
2. 该模型的自主运行效率接近此前需要更大、更昂贵模型才能达到的水平。
核心观点提炼高信息密度,值得细读
产品Claude Sonnet 5自主规划工具使用浏览器终端