公共早报06.30 早报
product / OCR / 基准测试 · 06.30 早报
导语今天这期 AIWatch 早报围绕「product、OCR、基准测试」展开,先用一段导语把当天主线收束起来,再按今日头条、推荐精选和补充速览逐条介绍。聚焦 8 · 关注 2 · 跟进 0。
productOCR基准测试
今日阅读路径
如果只有 20 分钟,先读:智谱AI在ModelScope发布GLM-5.2模型,支持100万上下文、更强编码能力,在多项基准上达到开源SOTA → 智谱AI发布GLM-5.2,在移动应用开发能力上实现大幅提升,内部基准测试完成率从21/70提升至48/70 → OpenAI 发布了 GPT-5.6 系列模型的有限预览,包括旗舰模型 Sol、均衡模型 Terra 和高效模型 Luna。
今天的主线不是孤立新闻,而是「product、OCR、基准测试」在不同层面的同步推进。
今日头条
精讲 1
产品智谱AI @Zai_org本月精选70/100
正文内容概括智谱AI发布GLM-5.2模型,在移动应用开发能力上实现大幅提升。内部基准测试包含35个挑战性移动开发任务,每个任务运行两次共70次试验,以核心功能无重大问题为完成标准。GLM-5.2完成率从GLM-5.1的21/70提升至48/70,提升超过两倍,但仍低于Claude Fable 5的56/70。对开发者而言,该模型在长周期任务上的进步值得关注。
核心观点:
1. GLM-5.2在内部移动开发基准测试中完成率从21/70提升至48/70,提升超过两倍。
2. 基准测试包含35个挑战性移动开发任务,每个任务运行两次共70次试验。
3. Claude Fable 5在该基准上完成率为56/70,高于GLM-5.2。
核心观点提炼高信息密度,值得细读
产品移动应用开发基准测试模型升级长周期任务
精讲 2
产品宝玉 @dotey当日精选66/100
正文内容概括Anthropic 发布 Claude Tag 的 Slack 集成功能,让团队在频道中 @ Claude 执行任务,Karpathy 称其为 LLM 交互的第三次重大重新设计。
核心观点提炼常规快讯,保留列表
产品
精讲 3
产品OpenAI Developers @OpenAIDevs本周精选77/100
正文内容概括OpenAI 发布了 GPT-5.6 系列模型的有限预览,包括旗舰模型 Sol、均衡模型 Terra 和高效模型 Luna。Sol 作为下一代前沿模型,Terra 面向日常高效工作,Luna 则针对高容量任务提供快速且经济的方案。此次发布为开发者提供了不同性能与成本梯度的选择,有助于在具体应用中灵活部署。
核心观点:
1. GPT-5.6 系列包含三个模型:旗舰 Sol、均衡 Terra 和高效 Luna,分别面向前沿、日常和高容量场景。
2. Luna 被定位为快速且经济的模型,适合高吞吐量任务。
核心观点提炼重磅首发或硬核洞察
产品GPT-5.6模型发布多模型策略成本优化
精讲 4
产品宝玉 @dotey本周精选71/100
正文内容概括OpenAI 于6月26日发布 GPT-5.6 系列模型,包含旗舰级 Sol、日常级 Terra 和经济级 Luna。因美国政府要求,目前仅向约20家经审批的合作伙伴开放预览。Sol 新增 max 深度推理与 ultra 多子 Agent 并行模式,在 Terminal-Bench 2.1 上 Sol Ultra 得分 91.9%。Terra 性能接近上一代 GPT-5.5 但价格减半,Luna 主打低成本高吞吐。7月将上线 Cerebras 硬件加速版本,推理速度达每秒750 token。对开发者而言,Terra 的高性价比和 Sol 的 ultra 模式值得关注。
核心观点:
1. Sol Ultra 在 Terminal-Bench 2.1 上得分 91.9%,高于 Claude Mythos 5 的 88% 和 Gemini 3.1 Pro Preview 的 70.7%。
2. Sol 在 ExploitBench 上用约三分之一的 token 达到 Mythos Preview 的网络安全水平。
3. Sol 的 ultra 模式可调用多个子 Agent 并行处理复杂任务,无需开发者自行搭建 Agent 编排框架。
核心观点提炼高信息密度,值得细读
产品Agent多Agent协作推理模型安全评测API定价
精讲 5
产品Tibo Sottiaux @thsottiaux当日精选66/100
正文内容概括OpenAI 为高级 Codex 用户推出了可复用、可继承的权限配置文件,替代了粗粒度的沙箱模式。该配置绑定操作系统强制规则(如文件读/写/拒绝,甚至支持 **/*.env 模式),并针对每个域和 Unix 套接字进行网络权限控制。此外,还提供了故障关闭的管理员允许列表,实现了每个任务的最小权限控制。这对开发者意味着更精细、更安全的代码执行环境。
核心观点:
1. 权限配置文件支持继承,可复用且绑定 OS 强制规则,实现比粗粒度沙箱更细粒度的控制。
2. 支持 **/*.env 等文件模式,以及按域和 Unix 套接字的网络权限控制。
3. 提供故障关闭的管理员允许列表,确保最小权限原则。
核心观点提炼高信息密度,值得细读
产品Codex权限控制安全沙箱最小权限
精讲 6
产品智谱AI @Zai_org本月精选73/100
正文内容概括智谱AI在ModelScope发布GLM-5.2模型,支持100万上下文窗口,并显著提升编码能力。该模型在Code Arena全球可用模型中排名第二,在FrontierSWE、SWE-Marathon和PostTrainBench等基准上成为排名最高的开源模型,性能介于Claude Opus 4.7和4.8之间。GLM-5.2采用KV8、LayerSplit、IndexShare等技术实现百万上下文,在Terminal-Bench 2.1上达到开源SOTA,较GLM-5.1提升17.5%。开发者可使用vLLM、SGLang、Transformers进行推理部署。
核心观点:
1. GLM-5.2在Code Arena全球所有可用模型中排名第二。
2. 在Terminal-Bench 2.1上达到开源SOTA,较GLM-5.1提升17.5%。
3. 采用KV8、LayerSplit、IndexShare技术实现100万上下文窗口。
核心观点提炼高信息密度,值得细读
产品开源模型编码能力百万上下文基准测试推理部署
推荐精选
精选 1
技术AI at Meta @AIatMeta72/100
正文内容概括Meta 发布了 Brain2Qwerty v1 论文(Nature Neuroscience)和 v2 模型。该技术能从非侵入性脑信号(MEG)解码句子,v2 版本性能达到新高度。对开发者而言,开源代码和数据集降低了脑机接口研究的门槛。
核心观点:
1. v1 论文发表于 Nature Neuroscience,v2 模型已公开。
2. v2 在非侵入式 MEG 设置下达到前所未有的解码性能。
核心观点提炼高信息密度,值得细读
技术脑机接口MEG非侵入式语言解码开源
摘要由 LLM 生成,请以原文为准。