作者提醒,聚焦每百万 token 的输入输出单价早已过时,缓存读取(cache read)成本才是代理型工作负载的最大开销。他算了一笔账:一个从 60k 上下文开始、每轮工具调用写 500 token 读 5,000 token 的代理会话,跑到 100 轮时缓存读取在 Claude Opus 5 账单中占到 76%,在 GPT 5.6 Sol 占 81.6%,且总成本随轮数近似二次方增长——因为每一轮都要重读已有的上下文。他还指出 KV 缓存在被大幅压缩后已能塞进 SSD/NVMe(1M 上下文约 5GB),这让缓存读取成为前沿实验室惊人利润的来源(估算约 $0.5/GB-小时,而 AWS 内存远低于 1 美分)。