Martin Alderson 通过分析指出,在AI代理工作负载中,缓存读取成本是主要成本驱动因素,而非传统的输入/输出成本。他对比了DeepSeek V4-Flash、Claude Opus 5和GPT 5.6 Sol在20轮和100轮会话中的成本构成,发现缓存读取占比随轮次增加而急剧上升,尤其是GPT 5.6 Sol在超过272k输入令牌后重新定价导致成本更高。此外,KV缓存压缩技术(如DeepSeek的算法)使缓存可卸载到NVMe,降低了硬件成本。开发者应关注缓存读取成本,优化工具调用次数,并注意不同提供商的定价差异。 核心观点: 1. 在100轮代理会话中,缓存读取成本占GPT 5.6 Sol总成本的81.6%,Claude Opus 5占76.4%,DeepSeek V4-Flash占48.1%。 2. GPT 5.6 Sol在输入超过272k令牌后重新定价,导致长会话成本比Claude Opus 5高70%。 3. DeepSeek的KV缓存压缩算法(Compressed Sparse Attention和Heavily Compressed Attention)使1M上下文窗口仅需约5GB内存。
Google AI Studio 新增直接导入 GitHub 仓库功能,允许开发者将整个代码库带入上下文窗口。这一更新简化了 AI 应用构建流程,使开发者能够更便捷地利用现有代码进行 AI 开发与调试。
腾讯正式开源 Hy3 模型,采用 295B/A21B MoE 架构与 256K 上下文窗口。相比预览版,任务成功率从 72% 提升至 90%,执行效率平均缩短 34%,文档处理 token 节省 47.4%,PPT 制作节省 49.0%(对比 GLM-5.2)。该模型已在元宝、ima、QQ 浏览器、微信读书、腾讯文档等产品中应用,形成数据循环强化。对开发者而言,Hy3 开源提供了高性价比的 MoE 大模型选择。 核心观点: 1. Hy3 采用 295B/A21B MoE 架构,上下文窗口达 256K。 2. 相比 Hy3 preview,任务成功率从 72% 提升至 90%,执行效率平均缩短 34%。 3. 文档处理 token 节省 47.4%,PPT 制作节省 49.0%(对比 GLM-5.2)。
Z ai 发布 GLM-5.2 开源模型,总参数 744B,激活参数 40B,在 Artificial Analysis Intelligence Index v4.1 上得分 51,领先于 MiniMax-M3 和 DeepSeek V4 Pro。相比 GLM-5.1,科学推理能力显著提升,CritPt 提高 16 分,HLE 提高 12 分。模型位于智能与成本帕累托前沿,每任务成本约 $0.46。上下文窗口扩展至 1M tokens,采用 MIT 许可证。开发者可通过 Z ai 官方 API 及多家第三方提供商使用。 核心观点: 1. GLM-5.2 在 Intelligence Index v4.1 得分 51,领先 MiniMax-M3 (44) 和 DeepSeek V4 Pro (44)。 2. 科学推理提升显著:CritPt +16 分至 21%,HLE +12 分至 40%。 3. 每任务输出 tokens 43k,高于 GLM-5.1 的 26k,成本 $0.46/任务。