Martin Alderson 通过分析指出,缓存读取成本是AI代理工作负载的主要成本驱动因素,并对比了DeepSeek、Claude和GPT的定价差异
Martin Alderson 通过分析指出,缓存读取成本是AI代理工作负载的主要成本驱动因素,并对比了DeepSeek、Claude和GPT的定价差异。
Martin Alderson 通过分析指出,在AI代理工作负载中,缓存读取成本是主要成本驱动因素,而非传统的输入/输出成本。他对比了DeepSeek V4-Flash、Claude Opus 5和GPT 5.6 Sol在20轮和100轮会话中的成本构成,发现缓存读取占比随轮次增加而急剧上升,尤其是GPT 5.6 Sol在超过272k输入令牌后重新定价导致成本更高。此外,KV缓存压缩技术(如DeepSeek的算法)使缓存可卸载到NVMe,降低了硬件成本。开发者应关注缓存读取成本,优化工具调用次数,并注意不同提供商的定价差异。 核心观点: 1. 在100轮代理会话中,缓存读取成本占GPT 5.6 Sol总成本的81.6%,Claude Opus 5占76.4%,DeepSeek V4-Flash占48.1%。 2. GPT 5.6 Sol在输入超过272k令牌后重新定价,导致长会话成本比Claude Opus 5高70%。 3. DeepSeek的KV缓存压缩算法(Compressed Sparse Attention和Heavily Compressed Attention)使1M上下文窗口仅需约5GB内存。