公共早报06.26 早报
MoE / product / 成本优化 · 06.26 早报
导语今天这期 AIWatch 早报围绕「MoE、product、成本优化」展开,先用一段导语把当天主线收束起来,再按今日头条、推荐精选和补充速览逐条介绍。聚焦 0 · 关注 1 · 跟进 3。
MoEproduct成本优化
今日阅读路径
如果只有 20 分钟,先读:DeepReinforce 发布了 MIT 许可的开源编程智能体模型家族 Ornith-1.0,旗舰 397B MoE 模型在 SWE-Bench 和 Terminal-Bench 上超越 Claude Opus 4.7 → 智谱AI的GLM-5.2在ARC-AGI-2上取得22.8%准确率,每任务成本0.25美元,相比2025年5月最佳模型提升7.6倍,成本仅为GPT-5.5的七分之一 → NVIDIA 发布 NeMo AutoModel,基于 Hugging Face Transformers v5 为 MoE 模型提供专家并行等优化,训练吞吐量提升 3.4 至 3.7 倍。
今天的主线不是孤立新闻,而是「MoE、product、成本优化」在不同层面的同步推进。
推荐精选
精选 1
产品Rohan Paul @rohanpaul_ai70/100
正文内容概括DeepReinforce 发布了 MIT 许可的开源编程智能体模型家族 Ornith-1.0,基于预训练的 Gemma 4 和 Qwen 3.5 构建。旗舰模型 Ornith-1.0-397B MoE(17B 活跃参数)在 SWE-Bench Verified 和 Terminal-Bench 2.1 上分别取得 82.4 和 77.5 的成绩,超越 Claude Opus 4.7。该系列采用新颖的自我改进训练策略,在强化学习中同时优化答案和任务脚手架(包括计划、记忆模式、工具节奏、错误处理和搜索过程)。9B 模型在 SWE-Bench Verified 上达到 69.4,表现突出。对开发者而言,这意味着获得了可自由使用、性能领先的开源编程智能体模型。
核心观点:
1. Ornith-1.0 采用自我改进训练策略,在 RL 中先让模型提出更好的任务脚手架,再用其生成解决方案,奖励同时更新两个阶段。
2. 旗舰 397B MoE 模型(17B 活跃参数)在 SWE-Bench Verified 上达 82.4,在 Terminal-Bench 2.1 上达 77.5,均超越 Claude Opus 4.7。
3. 9B 模型在 SWE-Bench Verified 上达到 69.4,展示了小参数模型的竞争力。
核心观点提炼高信息密度,值得细读
产品开源模型编程智能体MoESWE-BenchTerminal-Bench
补充速览
速览 1
产品Rohan Paul @rohanpaul_ai当日精选69/100
正文内容概括智谱AI发布GLM-5.2模型,在ARC-AGI-2基准测试中取得22.8%准确率,每任务成本0.25美元。相比2025年5月最佳模型(3.0%)提升7.6倍,成本仅为GPT-5.5($1.87/任务)的七分之一。在ARC-AGI-1上达到77.0%准确率,性能与GPT-5.4及GPT-5.5(低推理努力)相当。
核心观点:
1. GLM-5.2在ARC-AGI-2上22.8%准确率,较2025年5月最佳模型3.0%提升7.6倍。
2. GLM-5.2每任务成本$0.25,仅为GPT-5.5($1.87)的约七分之一。
3. GLM-5.2在ARC-AGI-1上77.0%准确率,性能与GPT-5.4及GPT-5.5(低推理努力)相当。
核心观点提炼高信息密度,值得细读
产品ARC-AGI-2ARC-AGI-1成本优化基准测试推理模型
速览 2
产品Hugging Face @huggingface当日精选68/100
正文内容概括NVIDIA 发布 NeMo AutoModel,基于 Hugging Face Transformers v5 构建,为 MoE 模型提供专家并行、DeepEP 和 TransformerEngine 内核等优化。用户仅需几行代码即可应用这些优化,使热门 MoE 模型的训练吞吐量提升 3.4 至 3.7 倍。该工具是 NeMo 框架的一部分,旨在简化大规模模型构建。
核心观点:
1. NeMo AutoModel 基于 Hugging Face Transformers v5,为 MoE 模型提供专家并行、DeepEP 和 TransformerEngine 内核优化。
2. 热门 MoE 模型使用 NeMo AutoModel 后训练吞吐量提升 3.4 至 3.7 倍。
核心观点提炼高信息密度,值得细读
产品MoE训练优化专家并行吞吐量提升
速览 3
产品OpenAI Blog当日精选74/100
正文内容概括OpenAI 与 Broadcom 联合推出定制 AI 芯片 Jalapeño,专为大语言模型推理优化,旨在提升 AI 系统的性能、效率与规模。该芯片针对 LLM 推理场景设计,有望降低推理成本并加速模型部署。对开发者而言,未来可能获得更高效、更低成本的推理服务,从而支持更大规模的应用。
核心观点提炼高信息密度,值得细读
产品定制芯片LLM推理性能优化成本优化
摘要由 LLM 生成,请以原文为准。