公共早报06.17 早报
product / Agent / 开源模型 · 06.17 早报
导语今天这期 AIWatch 早报围绕「product、Agent、开源模型」展开,先用一段导语把当天主线收束起来,再按今日头条、推荐精选和补充速览逐条介绍。聚焦 2 · 关注 5 · 跟进 1。
productAgent开源模型
今日阅读路径
如果只有 20 分钟,先读:智谱AI的GLM-5.2模型在OpenRouter上线,支持1M token上下文窗口,面向长时程编码智能体任务 → Z.ai 发布了 GLM-5.2 开源模型,具备 1M 上下文窗口和两种推理模式,专为智能体和长周期编码任务设计 → Parasail 上线 GLM-5.2 开源权重模型,在长周期智能体任务上接近闭源前沿,FrontierSWE 基准超越 GPT-5.5。
今天的主线不是孤立新闻,而是「product、Agent、开源模型」在不同层面的同步推进。
今日头条
精讲 1
产品智谱AI @Zai_org当日精选71/100
正文内容概括智谱AI的旗舰模型GLM-5.2已在OpenRouter平台上线。该模型专为长时程编码智能体任务设计,支持高达1M token的上下文窗口,能够在长且复杂的编码智能体工作中保持可靠性。这对开发者意味着可以处理更长的代码上下文和更复杂的智能体工作流。
核心观点:
1. GLM-5.2支持1M token上下文窗口,专为长时程编码智能体任务优化。
核心观点提炼高信息密度,值得细读
产品Agent长上下文编码智能体OpenRouter
精讲 2
产品智谱AI @Zai_org当日精选70/100
正文内容概括Z.ai 发布了 GLM-5.2 开源模型,具备 1M 上下文窗口和两种推理模式(High 和 Max),专为智能体和长周期编码任务设计。该模型在编码和智能体任务上有显著改进,已上线 Venice 平台,对 Pro 用户完全私有可用。
核心观点:
1. GLM-5.2 提供两种推理模式:GLM-5.2 (max) 和 GLM-5.2 (high),分别对应极限推理和高效推理。
2. 模型支持 1M 上下文窗口,专为长周期智能体编码任务设计。
核心观点提炼高信息密度,值得细读
产品开源模型1M上下文窗口推理模式智能体编码
推荐精选
精选 1
产品智谱AI @Zai_org72/100
正文内容概括Parasail 平台上线了 GLM-5.2 开放权重模型。该模型在长周期智能体任务上首次显著缩小了与闭源前沿模型的差距,在 FrontierSWE 基准测试中得分超过 GPT-5.5,仅次于 Opus 4.8。这为开发者提供了一个在复杂智能体工作流中接近顶级闭源性能的开源选择。
核心观点:
1. GLM-5.2 在 FrontierSWE 基准上超越 GPT-5.5,仅次于 Opus 4.8。
2. 该模型是首个在长周期智能体任务上接近闭源前沿的开放权重模型。
核心观点提炼高信息密度,值得细读
产品开放权重模型智能体基准测试Parasail
精选 2
产品智谱AI @Zai_org72/100
正文内容概括Fireworks AI 在权重开放当日即上线 GLM 5.2 模型,支持 100 万 token 上下文,定位为编码优先的前沿模型。该模型已在 SWE-bench、Terminal-Bench、GPQA 和 AIME 等基准上获得独立验证,为开发者提供可立即使用的编码场景推理能力。
核心观点:
1. GLM 5.2 支持 100 万 token 上下文窗口,面向编码优先场景。
2. 模型在 SWE-bench、Terminal-Bench、GPQA 和 AIME 基准上获得独立验证。
3. Fireworks AI 在权重开放当日即部署该模型,实现零日上线。
核心观点提炼高信息密度,值得细读
产品GLM 5.2100万token上下文SWE-benchTerminal-BenchGPQA
精选 3
技术宝玉 @dotey72/100
正文内容概括NVIDIA GEAR 实验室联合 CMU、UC Berkeley 发布 ENPIRE,首次让 AI agent 在真实物理世界自主操控机器人完成实验循环。系统自动完成环境搭建、策略改进、实验执行与失败分析,无需人工干预。在精细操作任务上达到 99% 成功率(pass@8)。测试了 Codex、Claude Code、Kimi Code 三款 agent,并发现多机器人并行探索存在物理 scaling law。代码将开源,可复现自运行机器人实验室。
核心观点:
1. ENPIRE 在精细操作任务(插 pin、穿扎带、剪扎带、插 GPU)上达到 99% 成功率(pass@8)。
2. 8 台机器人并行探索比 1 台或 4 台的研究推进速度快,但 token 消耗增加且 agent 间协调降低机器人利用率。
3. 测试了三款 agent:OpenAI Codex(GPT-5.5)、Anthropic Claude Code(Opus 4.7)、月之暗面 Kimi Code(Kimi K2.6),均能跑通全流程但研究进展速度有差异。
核心观点提炼高信息密度,值得细读
技术Agent机器人自主实验物理 scaling law精细操作
精选 4
产品智谱AI @Zai_org71/100
正文内容概括vLLM v0.23.0 发布,提供对智谱 GLM-5.2 模型的 Day-0 支持。GLM-5.2 是一款开放权重模型,拥有 1M token 上下文窗口,专为长周期编码智能体设计,可承载从需求到部署的完整开发工作流。开发者现可直接在 vLLM 上运行该模型,用于大规模代码实现、自动化研究和性能优化等场景。
核心观点:
1. GLM-5.2 提供两种推理力度:GLM-5.2 (max) 和 GLM-5.2 (high)。
2. 模型支持客户端和移动端工程,包含设备端调试循环。
核心观点提炼高信息密度,值得细读
产品vLLMGLM-5.21M上下文长周期编码智能体开放权重模型
精选 5
产品智谱AI @Zai_org70/100
正文内容概括DeepInfra 上线了智谱 AI 的 GLM-5.2 模型。该模型采用 744B/40B MoE 架构,MIT 许可,支持 1M 上下文窗口。在 FrontierSWE、PostTrainBench 和 SWE-Marathon 基准测试中,GLM-5.2 表现领先于其他开源模型。DeepInfra 提供该模型的 API 服务,定价为每百万 token 输入 $1.40、输出 $4.40、缓存 $0.25。开发者可通过 DeepInfra 平台直接调用该模型。
核心观点:
1. GLM-5.2 采用 744B/40B MoE 架构,支持 1M 上下文窗口,MIT 许可。
2. 在 FrontierSWE、PostTrainBench、SWE-Marathon 三项基准中,GLM-5.2 为表现最佳的开源模型。
3. DeepInfra 定价:输入 $1.40/1M tokens,输出 $4.40/1M tokens,缓存 $0.25/1M tokens。
核心观点提炼高信息密度,值得细读
产品MoE开源模型基准测试API定价1M上下文
补充速览
速览 1
产品Hugging Face @huggingface当日精选69/100
正文内容概括MiniMax 发布了 v3 模型,该模型集成了一个 MSA 内核。随着序列长度的增加,该内核能实现显著的加速效果。该内核已集成到 Hugging Face 的 transformers 库和 Kernel Hub 中,方便开发者直接使用。
核心观点:
1. MiniMax v3 模型集成的 MSA 内核,序列越长加速效果越明显。
2. MSA 内核已集成至 Hugging Face transformers 库和 Kernel Hub。
核心观点提炼高信息密度,值得细读
产品MiniMaxMSA加速Hugging Face
摘要由 LLM 生成,请以原文为准。