公共早报06.30 早报
product / OCR / 基准测试 · 06.30 早报
导语今天这期 AIWatch 早报围绕「product、OCR、基准测试」展开,先用一段导语把当天主线收束起来,再按今日头条、推荐精选和补充速览逐条介绍。聚焦 8 · 关注 2 · 跟进 0。
productOCR基准测试
今日阅读路径
如果只有 20 分钟,先读:智谱AI在ModelScope发布GLM-5.2模型,支持100万上下文、更强编码能力,在多项基准上达到开源SOTA → 智谱AI发布GLM-5.2,在移动应用开发能力上实现大幅提升,内部基准测试完成率从21/70提升至48/70 → OpenAI 发布了 GPT-5.6 系列模型的有限预览,包括旗舰模型 Sol、均衡模型 Terra 和高效模型 Luna。
今天的主线不是孤立新闻,而是「product、OCR、基准测试」在不同层面的同步推进。
今日头条
精讲 1
产品智谱AI @Zai_org本月精选70/100
正文内容概括智谱AI发布GLM-5.2模型,在移动应用开发能力上实现大幅提升。内部基准测试包含35个挑战性移动开发任务,每个任务运行两次共70次试验,以核心功能无重大问题为完成标准。GLM-5.2完成率从GLM-5.1的21/70提升至48/70,提升超过两倍,但仍低于Claude Fable 5的56/70。对开发者而言,该模型在长周期任务上的进步值得关注。
核心观点:
1. GLM-5.2在内部移动开发基准测试中完成率从21/70提升至48/70,提升超过两倍。
2. 基准测试包含35个挑战性移动开发任务,每个任务运行两次共70次试验。
3. Claude Fable 5在该基准上完成率为56/70,高于GLM-5.2。