Artificial Analysis 发布 AA-Briefcase 基准测试,用于评估 AI 模型在长期知识工作项目中的能力。该基准由行业专家构建,模拟数周的真实项目,包含数千个输入文件和多个关联任务。Claude Fable 5 以 1587 Elo 领先,但每任务平均成本 31 美元;开源模型 GLM-5.2 以 1266 Elo 和 2.40 美元成本提供了最佳性价比。测试显示,即使顶级模型也仅在 3% 的任务中满足所有标准,真实世界的复杂性仍是挑战。 核心观点: 1. AA-Briefcase 包含 25,000+ Slack 消息和 3,500+ 邮件等碎片化、矛盾的真实上下文,测试模型处理模糊信息的能力。 2. Claude Fable 5 在 91 个任务中仅 3% 满足所有评分标准,31 个任务无模型得分超 50%,表明长期知识工作难度极高。 3. GLM-5.2 (max) 以 1266 Elo 和 2.40 美元成本,成为最强性价比选项,仅比 Claude Opus 4.8 低约 90 Elo 但成本不足其 25%。
Artificial Analysis 发布 AA-Briefcase 基准测试,用于评估模型在长期、多步骤知识工作项目中的能力。测试场景由行业专家设计,包含数千输入文件(如 Slack 消息、邮件)。Claude Fable 5 以 1587 Elo 领先,但每任务成本约 $31;开源模型 GLM-5.2 以约 $2.40 成本取得 1266 Elo,性价比突出。所有模型在真实复杂任务中表现仍有限,顶级模型仅 3% 任务满足全部标准。 核心观点: 1. Claude Fable 5 在 AA-Briefcase 上以 1587 Elo 领先,未使用 Opus 4.8 回退。 2. GLM-5.2 (max) 以 $2.40 成本取得 1266 Elo,性价比优于 Claude Opus 4.8。 3. 所有模型在 91 个任务中仅 3% 满足全部 rubric 标准,31 个任务无模型得分超 50%。
Z ai 发布 GLM-5.2 开源模型,总参数 744B,激活参数 40B,在 Artificial Analysis Intelligence Index v4.1 上得分 51,领先于 MiniMax-M3 和 DeepSeek V4 Pro。相比 GLM-5.1,科学推理能力显著提升,CritPt 提高 16 分,HLE 提高 12 分。模型位于智能与成本帕累托前沿,每任务成本约 $0.46。上下文窗口扩展至 1M tokens,采用 MIT 许可证。开发者可通过 Z ai 官方 API 及多家第三方提供商使用。 核心观点: 1. GLM-5.2 在 Intelligence Index v4.1 得分 51,领先 MiniMax-M3 (44) 和 DeepSeek V4 Pro (44)。 2. 科学推理提升显著:CritPt +16 分至 21%,HLE +12 分至 40%。 3. 每任务输出 tokens 43k,高于 GLM-5.1 的 26k,成本 $0.46/任务。
智谱AI在ModelScope发布GLM-5.2模型,支持100万上下文窗口,并显著提升编码能力。该模型在Code Arena全球可用模型中排名第二,在FrontierSWE、SWE-Marathon和PostTrainBench等基准上成为排名最高的开源模型,性能介于Claude Opus 4.7和4.8之间。GLM-5.2采用KV8、LayerSplit、IndexShare等技术实现百万上下文,在Terminal-Bench 2.1上达到开源SOTA,较GLM-5.1提升17.5%。开发者可使用vLLM、SGLang、Transformers进行推理部署。 核心观点: 1. GLM-5.2在Code Arena全球所有可用模型中排名第二。 2. 在Terminal-Bench 2.1上达到开源SOTA,较GLM-5.1提升17.5%。 3. 采用KV8、LayerSplit、IndexShare技术实现100万上下文窗口。
DeepInfra 上线了智谱 AI 的 GLM-5.2 模型。该模型采用 744B/40B MoE 架构,MIT 许可,支持 1M 上下文窗口。在 FrontierSWE、PostTrainBench 和 SWE-Marathon 基准测试中,GLM-5.2 表现领先于其他开源模型。DeepInfra 提供该模型的 API 服务,定价为每百万 token 输入 $1.40、输出 $4.40、缓存 $0.25。开发者可通过 DeepInfra 平台直接调用该模型。 核心观点: 1. GLM-5.2 采用 744B/40B MoE 架构,支持 1M 上下文窗口,MIT 许可。 2. 在 FrontierSWE、PostTrainBench、SWE-Marathon 三项基准中,GLM-5.2 为表现最佳的开源模型。 3. DeepInfra 定价:输入 $1.40/1M tokens,输出 $4.40/1M tokens,缓存 $0.25/1M tokens。
Z.ai 发布了 GLM-5.2 开源模型,具备 1M 上下文窗口和两种推理模式(High 和 Max),专为智能体和长周期编码任务设计。该模型在编码和智能体任务上有显著改进,已上线 Venice 平台,对 Pro 用户完全私有可用。 核心观点: 1. GLM-5.2 提供两种推理模式:GLM-5.2 (max) 和 GLM-5.2 (high),分别对应极限推理和高效推理。 2. 模型支持 1M 上下文窗口,专为长周期智能体编码任务设计。
Google 本周密集发布多款 AI 产品与技术更新:推出 Gemini 3.5 Live Translate 实时语音翻译音频模型;升级 NotebookLM,新增聊天智能体能力、增强推理及多种输出格式;Project Genie 向全球 Google AI Ultra 5x 订阅者开放;Gemini App 的 Notebooks 扩展至欧洲经济区等地;并开源实验性文本扩散模型 DiffusionGemma。对开发者而言,DiffusionGemma 提供了探索非自回归文本生成的新路径,NotebookLM 的升级则强化了 AI 智能体在知识工作流中的实用价值。 核心观点: 1. NotebookLM 升级新增聊天智能体能力、更高级推理及新输出格式套件。 2. Project Genie 现面向 Google AI Ultra 5x 订阅者全球推出。 3. DiffusionGemma 是实验性开放模型,采用文本扩散方法实现极快的文本生成。
大模型高吞吐推理长期依赖专用加速器。Xiaomi MiMo 联合 TileRT 团队开源 MiMo-V2.5-Pro-FP4-DFlash 1T 模型,通过 FP4 量化降低显存占用与带宽压力,并引入 DFlash 块掩码并行推测解码提升验证效率;TileRT 编译器与 kernel 针对上述技术深度定制,最终在标准 8-GPU 单节点上实现 1000+ tps。该方案仅依赖通用 GPU,为开发者提供了可复现的大规模模型高效推理路径。 核心观点: 1. FP4量化降低模型footprint与memory traffic,DFlash块掩码并行推测解码单次验证可接受更多token。 2. MiMo与TileRT团队进行模型×系统深度协同设计,TileRT编译器与kernel针对FP4和DFlash精确优化。 3. 1T参数模型在标准8-GPU单节点上突破1000 tps,无需Cerebras晶圆级或Groq SRAM ASIC等专用硬件。