精讲 1
产品宝玉 @dotey本月精选71/100
正文内容概括OpenAI 于6月26日发布 GPT-5.6 系列模型,包含旗舰级 Sol、日常级 Terra 和经济级 Luna。因美国政府要求,目前仅向约20家经审批的合作伙伴开放预览。Sol 新增 max 深度推理与 ultra 多子 Agent 并行模式,在 Terminal-Bench 2.1 上 Sol Ultra 得分 91.9%。Terra 性能接近上一代 GPT-5.5 但价格减半,Luna 主打低成本高吞吐。7月将上线 Cerebras 硬件加速版本,推理速度达每秒750 token。对开发者而言,Terra 的高性价比和 Sol 的 ultra 模式值得关注。
核心观点:
1. Sol Ultra 在 Terminal-Bench 2.1 上得分 91.9%,高于 Claude Mythos 5 的 88% 和 Gemini 3.1 Pro Preview 的 70.7%。
2. Sol 在 ExploitBench 上用约三分之一的 token 达到 Mythos Preview 的网络安全水平。
3. Sol 的 ultra 模式可调用多个子 Agent 并行处理复杂任务,无需开发者自行搭建 Agent 编排框架。
核心观点提炼高信息密度,值得细读
产品Agent多Agent协作推理模型安全评测API定价
精讲 2
产品OpenAI Blog本月精选77/100
正文内容概括OpenAI 预览了下一代模型 GPT-5.6 Sol,该模型在编程、科学和网络安全方面能力更强,并配备了最先进的安全栈。对开发者而言,这意味着更强的代码生成与科学推理能力,同时安全机制得到升级。
核心观点提炼重磅首发或硬核洞察
产品GPT-5.6 Sol编程科学网络安全安全栈
精讲 3
产品Anthropic @AnthropicAI本周精选69/100
正文内容概括Anthropic 宣布美国商务部已解除对 Claude Fable 5 和 Mythos 5 的出口管制,将于次日恢复访问。此举对依赖这些模型的开发者意味着服务中断结束,可重新使用相关能力。
核心观点提炼高信息密度,值得细读
产品出口管制模型恢复Anthropic
精讲 4
产品宝玉 @dotey本周精选62/100
正文内容概括Anthropic 恢复上线 Fable 5 模型,调整使用配额和计费方式,并增加安全分类器以限制网络安全任务。
核心观点提炼常规快讯,保留列表
产品
精讲 5
产品OpenAI Blog本周精选66/100
正文内容概括OpenAI 发布了 GeneBench-Pro 基准测试,用于评估 AI 在基因组学、生物学和科学研究中的性能。
核心观点提炼常规快讯,保留列表
产品
精讲 6
产品Claude Blog本周精选65/100
正文内容概括Anthropic 宣布 Claude 模型在 Microsoft Foundry 上正式可用,托管于 Azure 并提供数据驻留选项。
核心观点提炼常规快讯,保留列表
产品
精讲 7
讨论AYi @AYi_AInotes当日精选54/100
正文内容概括小红书Red Skill平台数据显示AI技能分发量远超预期,作者认为其可能成为Agent时代首个面向普通人的AI能力分发入口。
核心观点提炼常规快讯,保留列表
讨论
精讲 8
技术Armin Ronacher当日精选66/100
正文内容概括Armin Ronacher 发现新版 Claude 模型(Opus 4.8、Sonnet 5)在调用 Pi 编辑工具时,会在嵌套的 edits[] 数组中凭空捏造 schema 中不存在的字段(如 requireUnique、oldText2、type 等),导致工具调用被拒绝。尽管实际编辑内容正确,但模型会添加多余键值。该问题在旧版模型中不存在,且与上下文相关:在智能体历史对话中复现率约 20%,去掉 thinking blocks 后减半,开启严格工具调用后消失。Ronacher 推测这是后训练阶段针对 Claude Code 生态优化的副作用——Claude Code 的客户端会容忍并修复格式错误,导致模型学会在宽松环境下产生“格式垃圾”。这对开发者意味着:若工具 schema 与 Claude Code 不一致,新版模型可能更不忠实于格式,需要更严格的约束解码或工具调用验证。
核心观点:
1. Opus 4.8 和 Sonnet 5 在 Pi 编辑工具调用中会凭空添加 schema 中不存在的键(如 requireUnique、oldText2、type、id、kind 等),而旧版模型无此问题。
2. 该问题在智能体多轮对话中复现率约 20%,去掉 thinking blocks 后减半,开启严格工具调用后完全消失。
3. Ronacher 推测后训练阶段针对 Claude Code 的宽松工具调用生态(自动修复格式错误)是导致模型产生格式垃圾的根本原因。
核心观点提炼高信息密度,值得细读
技术ClaudeOpus 4.8Sonnet 5工具调用格式忠实度
精讲 9
讨论OpenRouter @OpenRouter当日精选63/100
正文内容概括AgentCard 统计表明 OpenRouter 居 AI Agent 消费服务第三,仅次于 Amazon 和 OpenAI
核心观点提炼常规快讯,保留列表
讨论
精讲 10
技术Tencent Hunyuan @TencentHunyuan当日精选73/100
正文内容概括现有RL框架多针对单模态设计。腾讯混元开源UniRL,提供统一多模态强化学习基础设施,通过单一后训练循环覆盖扩散/流匹配模型、LLM/VLM及统一多模态模型。同步推出DRPO与Flow-DPPO两种原创算法,支持可插拔推理引擎与FSDP2扩展。开发者可用一套基础设施跨模态进行RL后训练,降低多模态模型对齐成本。
核心观点:
1. UniRL以单一RL循环(generate→score→advantage→update→sync)覆盖扩散/流匹配、LLM、VLM及统一多模态模型,模型与算法为独立轴。
2. Flow-DPPO基于精确散度为流匹配/扩散模型引入信任域掩码策略优化;DRPO为LLM RL引入平滑的优势加权二次正则化。
3. 基础设施支持train-side、SGLang、vLLM-Omni三种可插拔rollout引擎,并内置FSDP2分片与单配置三部署模式。
核心观点提炼高信息密度,值得细读
技术多模态强化学习后训练扩散模型流匹配开源基础设施
精讲 11
产品向阳乔木 @vista8当日精选50/100
正文内容概括YouMind 正式发布 1.0 版本,作为 AI 创作工具持续打磨生图与 Agent 优化能力,提供更成熟的产品体验。
核心观点提炼常规快讯,保留列表
产品
精讲 12
产品Claude Devs @ClaudeDevs当日精选55/100
正文内容概括ClaudeDevs 重置了所有用户的 5 小时和周速率限制,影响 API 调用配额管理。
核心观点提炼常规快讯,保留列表
产品
精讲 13
产品月之暗面 @Kimi_Moonshot当日精选49/100
正文内容概括Kimi API 推出充值优惠活动,充值 100 美元以上可获 20%-30% 额外配额,截止 7 月 2 日。
核心观点提炼低价值或偏离 AI-Dev
产品
精讲 14
产品MiniMax @MiniMax_AI当日精选57/100
正文内容概括MiniMax 官方转发社区为 M3 开放权重模型添加 mlx-vlm 支持的消息,展示在 M3 Ultra 上的运行效果。
核心观点提炼常规快讯,保留列表
产品
精讲 15
讨论宝玉 @dotey当日精选60/100
正文内容概括作者分析Claude Design与Codex的差距,指出模型能力是关键,Harness层可逆向,但GPT-5.5尚无法胜任高精度可交互原型生成。
核心观点提炼常规快讯,保留列表
讨论
精讲 16
技术MiniMax @MiniMax_AI当日精选57/100
正文内容概括社区为 MiniMax M3 模型在 MLX-VLM 上贡献了解码路径优化,实现更快解码和更轻量占用。
核心观点提炼常规快讯,保留列表
技术
精讲 17
产品MiniMax @MiniMax_AI当日精选63/100
正文内容概括NousResearch 的 Hermes Agent 使用 M3 模型自主学会 TouchDesigner 并完成艺术创作,展示了 agent 的自学习能力。
核心观点提炼常规快讯,保留列表
产品
精讲 18
产品向阳乔木 @vista8当日精选56/100
正文内容概括开发者发布了一个工具,可自动抓取AppStore评论并用DeepSeek进行信息挖掘,生成产品经理可用的分析结果,预计下周开源。
核心观点提炼常规快讯,保留列表
产品
精讲 19
讨论宝玉 @dotey当日精选64/100
正文内容概括SpaceX 以全股票交易 600 亿美元收购 Cursor 母公司 Anysphere,旨在获取 AI 模型分发层和开发者工作流入口。
核心观点提炼常规快讯,保留列表
讨论
精讲 20
讨论宝玉 @dotey当日精选63/100
正文内容概括一篇论文指出Claude Code的成功源于围绕简单AI循环构建的庞大工具、安全、记忆与恢复系统,而非复杂AI大脑。
核心观点提炼常规快讯,保留列表
讨论
精讲 21
讨论OpenAI Developers @OpenAIDevs当日精选54/100
正文内容概括FT报道OpenAI去年收入130亿美元,但支出340亿美元用于算力、人才和销售,揭示前沿AI的高昂成本。
核心观点提炼常规快讯,保留列表
讨论
精讲 22
产品Xiaomi MiMo @XiaomiMiMo当日精选53/100
正文内容概括小米 MiMo 发布旗舰 AI 模型 Claw,集成金山办公,宣称 token 消耗降低 40-60%。
核心观点提炼常规快讯,保留列表
产品
精讲 23
产品宝玉 @dotey当日精选54/100
正文内容概括baoyu-design skill 更新,支持在制作PPT、动画视频或网站时调用AI生图技能配图,并可导出为可编辑的PPTX格式。
核心观点提炼常规快讯,保留列表
产品
精讲 24
技巧宝玉 @dotey当日精选52/100
正文内容概括宝玉分享了通过Agent分析并修复Skill导出问题的迭代方法,形成自用-发现问题-让Agent分析解决-更新Skill的闭环流程。
核心观点提炼常规快讯,保留列表
技巧
精讲 25
技巧宝玉 @dotey当日精选50/100
正文内容概括宝玉分享将传统软件工程实践(需求分析、系统设计、代码审查、测试、CI/CD)迁移到人+Agent协作开发中的经验与建议。
核心观点提炼常规快讯,保留列表
技巧
精讲 26
技巧向阳乔木 @vista8当日精选55/100
正文内容概括开发者利用 Codex 内置浏览器和 Imagen 模型,无需 API 即可实现图片生成与标注修改,提供了一种更直觉的交互方式。
核心观点提炼常规快讯,保留列表
技巧
精讲 27
产品数字生命卡兹克 @Khazix0918当日精选60/100
正文内容概括微信灰度测试Agent小微,开放好友消息、红包、日程、公众号/视频号问答、AI创建小工具等能力,远超预期。
核心观点提炼常规快讯,保留列表
产品
精讲 28
技巧OpenRouter @OpenRouter当日精选49/100
正文内容概括OpenRouter 提示用户若安装 1Password 可自动检测并帮助保存 API 密钥,提升密钥管理便利性。
核心观点提炼常规快讯,保留列表
技巧
精讲 29
产品宝玉 @dotey当日精选51/100
正文内容概括Codex 修复了疯狂写磁盘的 bug,需手动更新 CLI 到 0.142.0,提供了两种更新方式。
核心观点提炼常规快讯,保留列表
产品
精讲 30
产品xAI @xai当日精选56/100
正文内容概括xAI 在 Grok Build 中集成了官方 MongoDB 插件,支持查询数据、优化索引和管理数据库。
核心观点提炼常规快讯,保留列表
产品