人工智能

KV Cache:从注意力的副产品到 AI 基础设施的核心对象

曾经只是注意力层内部的一项记账优化,KV cache 如今已成为推理经济学、服务架构乃至存储硬件共同围绕的对象。本文梳理这一转变的来龙去脉,以及它对构建者的实际意义。

过去十年,AI 基础设施基本是围绕一个动词设计的:训练。集群为稠密矩阵乘法而建,用 FLOPs 做基准,按机架能塞进多少 GPU 来定规模。推理是事后才考虑的事——昂贵部分结束之后才做的事。

这个前提在今年失效了。Gartner 2026 年 8 月的预测显示,全球 AI 优化型 IaaS 支出将达到 423 亿美元,同比增长 96.4%,并且推理支出(233 亿美元)首次超过训练支出(190 亿美元)。2026 年推理占该市场的 55%,2027 年预计升至 59%。这不是数值上的擦边,而是结构性的转折:智能体系统把每个用户请求变成几十次模型调用,而且与训练不同,推理永不停歇。

对构建者而言,关键在于:训练受算力约束,服务则受状态约束。而让服务受状态约束的那个状态有个名字——KV cache。它最初只是一项内部优化:缓存注意力层的键与值张量,避免每生成一个 token 都重算。如今,推理经济学、服务架构乃至存储硬件,都在围绕它重新组织。

一切起于内存算式

KV cache 的规模由一个写起来简单、承受起来残酷的公式决定:2 × 层数 × KV 头数 × head_dim × 序列长度 × batch × 每元素字节数。PagedAttention 论文(Kwon 等,SOSP 2023)给出了经典算例:对 13B 参数的 OPT 模型,单个 token 的 KV cache 是 800 KB(2 × 5120 隐藏维度 × 40 层 × 2 字节),一个 2048 token 的请求就要吃掉 1.6 GB。在一张 40 GB A100 上服务该模型时,约 65% 显存给了静态权重,接近 30% 给了 KV cache——而在这部分 KV cache 显存中,真正存放 token 状态的只有 20.4% 到 38.2%,其余全部消耗在碎片与超额预留上。

把同一公式套到 fp16 下的 Llama-3-70B 级别模型(80 层、8 个 KV 头、head_dim 128),每 token 约 320 KB——这正是 1M token 上下文意味着 300 GB 量级 KV cache、数倍于模型自身权重的原因。长上下文首先不是算力问题,而是内存容量问题,而这份内存就是 KV cache。

三次觉醒

第一次,它成为内存管理问题。 PagedAttention 从操作系统借来虚拟内存与分页机制:把 KV cache 块当作页、token 当作字节、请求当作进程。结果是近乎零浪费与块级跨请求共享,在同等延迟下比 FasterTransformer 和 Orca 提升 2–4 倍吞吐。KV cache 由此被重新定义为需要分配、共享和淘汰的东西——一种资源,而非一个张量。

第二次,它成为被定价的商品。 vLLM 在 v0.4.0 引入自动前缀缓存,商业 API 厂商随之推出的则不只是性能特性,而是一项折扣。OpenAI 的文档显示,折扣随推理栈成熟而加深:GPT-4o 为 50%,GPT-4.1 为 75%,GPT-5 系列达到 90%(每百万输入 token $0.125 对 $1.25),延迟最多可降低约 80%,在 15 万 token 以上的提示中首 token 时间快 67%。Anthropic 的倍数写得更直白:缓存写入为基础输入价的 1.25 倍(5 分钟)或 2 倍(1 小时),缓存读取为 0.1 倍——Claude Sonnet 4.6 命中时从每百万 $3 降至 $0.30。DeepSeek 更进一步把缓存放到硬盘上,推出上下文缓存,命中价每百万 token 0.1 元,未命中 1 元。

缓存命中如今是一张九折到一折的优惠券,你必须先把它设计出来,再守住它。OpenAI 的官方指引说得很不客气:前缀必须稳定,1024 token 以下的提示根本不会缓存,而仅仅调整工具定义的顺序,就会静默地击穿下游所有缓存。

第三次,它成为调度对象。 最清晰的表达是 Mooncake——月之暗面 Kimi 底层的服务平台,以《Mooncake: Trading More Storage for Less Computation》(以存换算)为题获得 USENIX FAST 2025 埃里克·里德尔最佳论文奖。Mooncake 把 prefill 与解码拆成独立集群,并把 GPU 集群中闲置的 CPU、DRAM、SSD 和网卡资源汇聚成分布式 KV cache 池(Mooncake Store),由一个感知 KV cache 的全局调度器编排。实测结果:真实负载下 Kimi 多处理 75% 的请求;有效请求能力提升 59%–498%;A800 与 H800 集群分别多服务 115% 和 107% 的请求;数千节点日处理超 1000 亿 token。其 RDMA Transfer Engine 在 4×200 Gbps 下达到 87 GB/s、8×400 Gbps 下达到 190 GB/s,比 TCP 快 2.4 倍和 4.6 倍。全局缓存命中率最高比节点本地缓存高 136%,prefill 的 GPU 时间最多节省 48%。

开源项目 LMCache 把同一思路推得更远,把 KV cache 当作可以跨 GPU、CPU 内存、本地磁盘与远程后端存储、压缩、检索、迁移和观测的对象。它的学术前身 CacheGen(SIGCOMM 2024)证明 KV cache 可被编码压缩 3.5–4.3 倍,首 token 时间降低 3.2–3.7 倍;AMD 在 2026 年 1 月基于 vLLM 与 MI300X 的基准测试报告长文档问答有 3–10 倍提升。

2026:它进入硬件

最能说明这不是软件层面一阵风的信号,出现在 2026 年 1 月的 CES。NVIDIA 发布由 BlueField-4 DPU 驱动的 Inference Context Memory Storage(ICMS)平台,新闻稿把论点写得毫不含糊:"KV cache 无法长期存放在 GPU 上,否则会给多智能体系统中的实时推理造成瓶颈。" ICMS 扩展 GPU 显存容量,支持机架级集群间高带宽共享 KV cache,宣称相比传统存储可实现最高 5 倍的 tokens/s 与最高 5 倍的能效,并与 DOCA、NIXL、Dynamo 及 Spectrum-X 以太网深度集成。Dell、HPE、IBM、Pure Storage、VAST Data、WEKA、DDN、Hitachi Vantara、Nutanix、Supermicro、Cloudian、AIC 十二家存储厂商加入,2026 年下半年供货。黄仁勋的表述异常直接:"AI 正在革新整个计算栈——而现在,轮到存储了。"

硬件也在围绕同一对象重塑。2025 年 9 月发布的 Rubin CPX 被称为首款专为海量上下文处理打造的 CUDA GPU:30 PFLOPS NVFP4 算力、128 GB GDDR7、3 倍于 GB300 NVL72 的注意力性能,Vera Rubin NVL144 CPX 机架则集成 8 EFLOPS 算力与 100 TB 高速内存。2026 年 8 月,SK 海力士与闪迪通过开放计算项目(OCP)发布首份 HBF(高带宽闪存)开放规范——一个介于 HBM 与 SSD 之间的新层级,单栈最高 512 GB、带宽 0.4–3.0 TB/s、采用 UCIe 互连,谷歌与 Tenstorrent 参与了技术验证。

一个存储层级、一个 GPU 新品类、一项内存标准,都为同一个数据结构而生。

反向的力量:架构试图消灭它

朝相反方向奔跑的,是多年来旨在让 KV cache 变小甚至消失的架构工作。多头潜在注意力(MLA)(DeepSeek-V2,2024)把 KV 压缩进潜在向量,缓存体积减少 93.3%,最大生成吞吐提升至 5.76 倍。原生稀疏注意力 NSA(DeepSeek,2025)报告 64K 序列解码加速 11.6 倍;V3.2 中的 DeepSeek 稀疏注意力(DSA)把 API 价格下调 50–75%,在 128K 长度下 prefill 成本降低约 3.5 倍、解码降低 6–7 倍。Kimi Linear(2025 年 10 月)用 Kimi Delta Attention 与 MLA 的混合结构,把 KV cache 用量降低最多 75%,同时在 1M 上下文下实现最高 6 倍解码吞吐——值得注意的是,在完全相同的训练配方下它击败了纯 MLA。

但这些都不会让 KV cache 的绝对量变小,因为每一次效率提升都会立刻被更长的上下文和更多的智能体消耗掉。斯坦福数字经济实验室发现,智能体编码任务的 token 消耗可达简单代码问答的 1000 倍,同一任务的成本在不同运行之间最多相差 30 倍,且成本几乎全部压在输入侧——智能体几乎每一步行动前都要重读它积累的上下文。Elastic 引用的一项 2026 年针对 30 个生产工程团队的审计显示,重发上下文占智能体推理账单的 62%。压缩移动的是前沿,而不是取消这个品类。

构建者该怎么办

实际结论是:缓存命中率已成为与延迟、错误率并列的一线生产指标。具体来说:

1. 埋点观测。 各大 API 都在 usage 对象中返回缓存 token 数。看不到命中率,你就无法管理最大的成本杠杆。
2. 为稳定前缀而设计提示词。 静态内容(系统提示、工具定义、检索文档)放前面,可变内容放后面。改动一个 token,折扣读取就会退回全价。
3. 把 KV cache 当作分层存储问题,而非 GPU 问题。 Dynamo、LMCache、llm-d 已在 HBM、主机内存、本地 NVMe 与对象存储之间管理它;正确的问题不再是"有多少显存",而是"分几层、每层保有多少命中率"。
4. 盯住标准层。 llm-d——一个 Kubernetes 原生的分布式推理栈,由 IBM Research、Red Hat 与 Google Cloud 于 2026 年 3 月捐赠进入 CNCF Sandbox,NVIDIA、CoreWeave、AMD、Cisco、Hugging Face、Intel、Lambda、Mistral AI 参与协作——把 KV cache 感知路由与分层卸载变成了控制平面的职责。其生产数据称,感知缓存的路由在维持延迟 SLO 的同时把基础设施成本降低 30–50%,AWS 已为其提供带 Elastic Fabric Adapter 支持的专用容器。与此同时,vLLM 社区已有关于 KV cache 互操作 API 标准化的公开提案。

最后值得直说的判断是:KV cache 正在经历数据库曾经经历过的那次转变——当缓冲池不再是一个内部实现细节,而变成被管理、被定价、被分层的资源,拥有自己的厂商、格式与标准组织。判据不在论文里,而在 NVIDIA 为它造了一颗 DPU 和一整个存储平台。没有人会为实现细节建一个存储层级。谁掌握了 KV cache 的存放位置,谁就掌握了每一个被服务出去的 token 的成本。

#KV Cache#AI Infrastructure
来源
  • Gartner. (2026). Gartner Forecasts Worldwide AI-Optimized IaaS Spending to Grow 96% Through 2026. Gartner Newsroom, August 10, 2026.
  • Kwon, W., Li, Z., Zhuang, S., Sheng, Y., Zheng, L., Yu, C. H., Gonzalez, J., Zhang, H., & Stoica, I. (2023). Efficient Memory Management for Large Language Model Serving with PagedAttention. SOSP 2023, arXiv:2309.06180.
  • Qin, R., Li, Z., He, W., Zhang, M., Wu, Y., Zheng, W., & Xu, X. (2025). Mooncake: Trading More Storage for Less Computation — A KVCache-centric Architecture for Serving LLM Chatbot. USENIX FAST 2025 (Erik Riedel Best Paper Award).
  • Tsinghua University Department of Computer Science. (2025). 计算机系团队获得第23届USENIX文件与存储技术会议(FAST25)最佳论文奖. Tsinghua CS News.
  • Mooncake Team. (2025). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. GitHub kvcache-ai/Mooncake.
  • NVIDIA. (2026). NVIDIA BlueField-4 Powers New Class of AI-Native Storage Infrastructure for the Next Frontier of AI. NVIDIA Investor Relations, January 5, 2026.
  • NVIDIA. (2025). NVIDIA Unveils Rubin CPX: A New Class of GPU Designed for Massive-Context Inference. NVIDIA Newsroom, September 9, 2025.
  • SK hynix. (2026). SK hynix Unveils First HBF Standard Specifications with Sandisk, Presenting AI Memory Solutions at 'FMS 2026'. SK hynix Newsroom, August 4, 2026.
  • Sandisk. (2026). Sandisk and SK hynix Advance Global Standardization of High Bandwidth Flash with Release of First OCP Technical Specification. Sandisk Investor Relations, August 3, 2026.
  • DeepSeek-AI. (2024). DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model. arXiv:2405.04434.
  • DeepSeek-AI. (2025). Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention. arXiv:2502.11089.
  • Kimi Team. (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692.
  • Liu, Y., et al. (2024). CacheGen: KV Cache Compression and Streaming for Fast LLM Serving. ACM SIGCOMM 2024, arXiv:2310.07240.
  • LMCache Team. (2026). AMD × LMCache: AMD GPU Acceleration with LMCache. LMCache Blog, January 9, 2026.
  • OpenAI. (2026). Prompt Caching 201. OpenAI Cookbook; OpenAI API Pricing Documentation.
  • Anthropic. (2026). Prompt Caching; Pricing. Claude Platform Documentation.
  • DeepSeek. (2024). 上下文硬盘缓存 (Context Caching on Disk). DeepSeek News / API Documentation.
  • Brynjolfsson, E., Pentland, S., Pei, J., et al. (2026). How Do AI Agents Spend Your Money? Analyzing and Predicting Token Consumption in Agentic Coding Tasks. Stanford Digital Economy Lab.
  • Elastic. (2026). How IT leaders can measure and improve agentic AI value and cost. Elastic Resources.
  • IBM Research, Red Hat & Google Cloud. (2026). llm-d donated to the CNCF as a Sandbox project. CNCF Blog, KubeCon + CloudNativeCon Europe, March 24, 2026.
  • The Decoder. (2025). Deepseek slashes API prices by up to 75 percent with its latest V3.2 model. October 2025.