跳转至

Long-Context KV Cache Systems

导言

本文调研 2021—2026 年 SIGCOMM、NSDI、OSDI、SOSP、EuroSys、USENIX ATC、FAST、MLSys、ISCA、HPCA、ICML 和 NeurIPS 中与长序列、大规模 LLM 推理及 KV cache 管理直接相关的工作,重点关注分页、压缩、稀疏选择、复用、分层存储、卸载、Prefill/Decode 解耦、远程传输、GPU Direct Storage、CXL 和网络内计算。

检索截至 2026-08-24。会议归属以官方 proceedings 或会议程序为准;仅有 arXiv 或项目技术报告的工作被单独列出,不能与正式顶会论文混为一谈。

结论

  1. 2023 年是系统化 KV cache 管理的起点。 SOSP 2023 的 PagedAttention 把操作系统分页思想引入 KV cache,之后研究迅速分成内存管理、压缩/稀疏、跨请求复用、分层存储和跨节点传输几条路线。2021—2022 年的顶会工作更多是 Transformer/LLM serving 基础设施,例如 OSDI 2022 的 Orca,不是专门的 KV cache 管理方案。
  2. 长上下文使问题从“显存分配”演化成“分布式数据系统”。 Mooncake、Strata、SYMPHONY、LMCache 等工作把 KV cache 放进 GPU HBM、CPU DRAM、SSD、远程内存和网络构成的层级中,并联合设计缓存、I/O 和调度。
  3. P/D 解耦把 KV cache 变成网络负载。 DistServe、Splitwise 先建立 Prefill/Decode 分离范式,CacheGen、HACK、KVDirect、KVServe、DualPath 和 KVCodec 则直接优化 KV 的压缩或传输路径。
  4. “直驱”有多种不同语义。 需要区分 GPU Direct Storage、GPU RDMA、GPU 直接访问 CPU/CXL 内存、网络内聚合,以及华为 CloudMatrix384 的 AIV-Direct;它们旁路的组件和服务的数据类型并不相同。

AIV-Direct 不是 KV cache 直传名称

Serving Large Language Models on Huawei CloudMatrix384 原文中,AIV-Direct 指 AI Vector Core 经 UB 互连直接写远端 NPU 内存、绕过 SDMA 启动开销的机制,主要用于 MoE 的 FusedDispatch/FusedCombine 小消息通信。论文中的 Prefill→Decode KV cache 传输走独立 RDMA plane;历史 KV 的 Context Caching 则基于 UB 连接的分布式 DRAM/SSD 池。因此,“AIV-Direct 本身是 KV cache 直驱”这一说法不准确,但该论文整体确实包含与远程、分层 KV cache 密切相关的系统设计。

核心必读

以下清单优先覆盖“设计范式发生变化”的工作,而不是把所有 KV 压缩算法都纳入主线。

论文 会议 年份 主题关系 直接研究 KV cache
Efficient Memory Management for Large Language Model Serving with PagedAttention SOSP 2023 用分页和块映射消除 KV cache 碎片与冗余复制,是 vLLM 的基础。
CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving SIGCOMM 2024 为远程复用 KV cache 设计张量编码和带宽自适应流式传输。
InfiniGen: Efficient Generative Inference of Large Language Models with Dynamic KV Cache Management OSDI 2024 将 KV 主体卸载到 CPU,只预取查询相关的重要 KV 项。
DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving OSDI 2024 分离 Prefill 与 Decode,并按带宽约束放置两阶段;KV 传输是解耦代价。 部分
LoongServe: Efficiently Serving Long-Context Large Language Models with Elastic Sequence Parallelism SOSP 2024 用弹性序列并行动态伸缩单请求所占 GPU,减少长上下文 KV 迁移与内存碎片。
Cost-Efficient Large Language Model Serving for Multi-turn Conversations with CachedAttention USENIX ATC 2024 用 GPU/CPU/SSD 分层 AttentionStore 保存多轮会话 KV,并重叠载入与计算。
DéjàVu: KV-cache Streaming for Fast, Fault-tolerant Generative LLM Serving ICML 2024 以 KV streaming 支撑 P/D 解耦、微批交换和故障恢复。
Splitwise: Efficient Generative LLM Inference Using Phase Splitting ISCA 2024 按 Prefill/Decode 特性分配异构资源,是 KV 跨阶段移动的重要基线。 部分
CacheBlend: Fast Large Language Model Serving for RAG with Cached Knowledge Fusion EuroSys 2025 选择性重算并融合非前缀文本块的历史 KV,面向 RAG。
vAttention: Dynamic Memory Management for Serving LLMs without PagedAttention ASPLOS 2025 用 CUDA 虚拟内存维护连续 KV 地址空间,是 PagedAttention 之外的内存管理路线。
Mooncake: Trading More Storage for Less Computation — A KVCache-centric Architecture for Serving LLM Chatbot FAST 2025 在生产集群中构建 CPU/DRAM/SSD/NIC 组成的分布式 KV cache 与全局调度器。
IMPRESS: An Importance-Informed Multi-Tier Prefix KV Storage System for Large Language Model Inference FAST 2025 在 GPU、CPU、磁盘层级中只加载重要 Prefix KV,降低磁盘 I/O。
InstAttention: In-Storage Attention Offloading for Cost-Effective Long-Context LLM Inference HPCA 2025 把 KV cache 和 Decode Attention 下沉到计算存储设备,并优化 GPU↔CSD P2P。
HACK: Homomorphic Acceleration via Compression of the Key-Value Cache for Disaggregated LLM Inference SIGCOMM 2025 压缩 P/D 间 KV,且直接在量化 KV 上计算以避免重反量化。
KVCache Cache in the Wild: Characterizing and Optimizing KVCache Cache at a Large Cloud Provider USENIX ATC 2025 基于真实云服务轨迹刻画 KV 复用,并设计 workload-aware 淘汰策略。
Jenga: Effective Memory Management for Serving LLM with Heterogeneity SOSP 2025 针对层间 KV/embedding 异质性设计两级分配器和逐层缓存、淘汰策略。
DiffKV: Differentiated Memory Management for Large Language Models with Parallel KV Compaction SOSP 2025 按层和 Token 差异化压缩 KV,并在 GPU 上并行整理压缩后的内存。
HiFC: High-efficiency Flash-based KV Cache Swapping for Scaling LLM Inference NeurIPS 2025 使用 GPU Direct Storage 在 GPU 与 NVMe SSD 间直接交换 KV,绕过 Host DRAM。
Strata: Hierarchical Context Caching for Long Context Language Model Serving OSDI 2026 面向 HBM/DRAM/SSD 层级缓存,联合优化 GPU-assisted I/O、布局与 cache-aware 调度。
No Buffer, No Bottleneck: Efficient Zero-Copy KV Cache Offloading for Long-Context LLMs OSDI 2026 DirectKV 让 GPU kernel 经 NVLink-C2C 直接访问 CPU 驻留 KV,去掉 GPU staging buffer。
ECHO: Efficient KV Cache Offloading with Lossless Prefetching for Serving Native Sparse Attention LLMs OSDI 2026 为原生稀疏注意力设计无损 KV 预取和融合流水线。
SYMPHONY: Enabling Compute-Memory Disaggregation in LLM Serving Systems NSDI 2026 将计算与 KV 存储解耦,并用提示预取、优先级与协同内存管理控制远程缓存。
KVServe: Service-Aware KV Cache Compression for Communication-Efficient Disaggregated LLM Serving SIGCOMM 2026 按网络、SLO 和质量预算在线选择 KV 压缩方案。
DualPath: Accelerating Agentic LLM Inference by Harvesting Disaggregated KV-Cache Storage I/O SIGCOMM 2026 同时利用 Prefill 与 Decode 节点的存储 NIC,以双路径加载并通过 RDMA 回传 KV。
Efficient Remote KV Cache Reuse with GPU-native Video Codec SIGCOMM 2026 KVCodec 使用 GPU 原生视频编解码压缩远程 KV,并流水化传输与恢复。

与 AIV-Direct 相近的数据路径

这些工作未必都以 KV cache 为唯一对象,但都在尝试让加速器、网络或存储设备直接发起/完成数据移动或近数据计算,是理解“直驱”设计空间的关键对照。

论文 会议或状态 直通语义 与 KV cache 的关系
Serving Large Language Models on Huawei CloudMatrix384 技术报告,2025 AIV Core 经 UB 直接写远端 NPU 内存,绕过高启动开销的 SDMA。 报告另有 RDMA KV 传输和 UB 分离式缓存池;AIV-Direct 本身主要服务 MoE 通信。
GPU-Initiated On-Demand High-Throughput Storage Access in the BaM System Architecture ASPLOS 2023 GPU 直接管理 NVMe 访问的控制与数据路径,降低 CPU 参与。 不是 LLM/KV 专用,但属于 GPU 直驱存储的基础架构。
GeminiFS: A Companion File System for GPUs FAST 2025 GPU 直接以文件语义访问 NVMe,旁路 CPU 数据路径。 不是 KV 专用,可作为 SSD-backed KV 系统的底层对照。
Aqua: Network-Accelerated Memory Offloading for LLMs in Scale-Up GPU Domains ASPLOS 2025 借助网络和空闲 Peer GPU 内存加速 LLM 状态卸载。 面向 LLM 内存压力,覆盖 KV 等请求状态,但范围不只 KV。
InstAttention: In-Storage Attention Offloading for Cost-Effective Long-Context LLM Inference HPCA 2025 通过 GPU↔计算存储设备 P2P,在存储侧执行 Decode Attention。 KV cache 与 Attention 都下沉到计算存储。
No Buffer, No Bottleneck: Efficient Zero-Copy KV Cache Offloading for Long-Context LLMs OSDI 2026 GPU kernel 经 NVLink-C2C 直接访问 CPU 驻留 KV,取消 HBM staging buffer。 最接近“KV cache 直访远端层级”的正式顶会工作。
DualPath: Accelerating Agentic LLM Inference by Harvesting Disaggregated KV-Cache Storage I/O SIGCOMM 2026 同时利用 Prefill/Decode 两侧存储路径,并经 RDMA 回传。 直接优化分离式 KV cache 的存储与网络 I/O。

扩展正式论文

内存、稀疏与量化

论文 会议 年份 主题关系 直接研究 KV cache
Prompt Cache: Modular Attention Reuse for Low-Latency Inference MLSys 2024 用显式 schema 复用可组合 Prompt 模块的 KV state。
Keyformer: KV Cache reduction through key tokens selection for Efficient Generative Inference MLSys 2024 仅保留高注意力的 key tokens。
Q-Hitter: A Better Token Oracle for Efficient LLM Inference via Sparse-Quantized KV Cache MLSys 2024 联合稀疏与量化 KV。
KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache ICML 2024 针对 Key/Value 不同分布采用 2-bit 非对称量化。
QUEST: Query-Aware Sparsity for Efficient Long-Context LLM Inference ICML 2024 以 Query 选择要加载的 Top-K KV pages。
ALISA: Accelerating Large Language Model Inference via Sparsity-Aware KV Caching ISCA 2024 结合稀疏窗口注意力与 GPU/CPU 动态 KV 调度。
NEO: Saving GPU Memory Crisis with CPU Offloading for Online LLM Inference MLSys 2025 将部分 Attention 计算与 KV state 卸载到 CPU。
LServe: Efficient Long-sequence LLM Serving with Unified Sparse Attention MLSys 2025 分层选择 KV pages,统一 Prefill/Decode 稀疏注意力。
TurboAttention: Efficient attention approximation for high throughputs llm MLSys 2025 量化 KV 并直接执行低精度 Attention。
Rethinking Key-Value Cache Compression Techniques for Large Language Model Serving MLSys 2025 从生产实现角度重新评估 KV 压缩的吞吐、延迟和质量。
FlexiCache: Leveraging Temporal Stability of Attention Heads for Efficient KV Cache Management MLSys 2026 按 Attention Head 稳定性在 GPU/CPU 间分层放置 KV pages。
OPKV: A High-Throughput Plugin-Driven Framework for Recallable Sparsity in Paged KV Cache Systems MLSys 2026 将可召回稀疏策略以插件形式接入分页 KV 系统。
SuperInfer: SLO-Aware Rotary Scheduling and Memory Management for LLM Inference on Superchips MLSys 2026 在 GH200 上通过 NVLink-C2C 双向搬运 KV 并联合 SLO 调度。

复用、存储与跨节点移动

论文 会议 年份 主题关系 直接研究 KV cache
InferCept: Efficient Intercept Support for Augmented Large Language Model Inference ICML 2024 工具调用暂停期间在保留、CPU swap 和丢弃 KV 之间自适应选择。
DroidSpeak: KV Cache Sharing Across Fine-tuned Model Variants NSDI 2026 跨同架构微调模型与节点复用 KV,并流水化选择性重算。
Libra: Flexible Request Partitioning and Scheduling for Serving Unbalanced and Dynamic LLM Workloads NSDI 2026 用分块 KV 传输支持跨实例 micro-request。 部分
SolidAttention: Low-Latency SSD-based Serving on Memory-Constrained PCs FAST 2026 在 SSD 上存放 KV,并以块聚合和推测预取支持 128K 上下文。
CacheSlide: Unlocking Cross Position-Aware KV Cache Reuse for Accelerating LLM Serving FAST 2026 支持相对位置相关的 KV 复用和 spill-aware 管理。
Bidaw: Enhancing Key-Value Caching for Interactive LLM Serving via Bidirectional Computation–Storage Awareness FAST 2026 联合计算调度与 DRAM/SSD 两层 KV 淘汰。
ContextPilot: Fast Long-Context Inference via Context Reuse MLSys 2026 对跨交互上下文对齐、去重,扩大 KV reuse。
Turbo: Efficiently Serving Long-Context Large Language Models with In-Network Aggregation SIGCOMM 2026 将长上下文推理中的聚合放入网络数据面,属于 KV/Attention 数据路径邻近工作。 部分
TurboBus: Pooling PCIe Bandwidth for LLM Workloads via Scale-Up Fabrics SIGCOMM 2026 池化 PCIe 带宽,并加速 KV-offloaded inference。 部分

其他正式出版

以下论文已经正式出版,但不属于本文重点列举的顶级会议,因技术相关而保留。

论文 出版物 年份 主题关系 直接研究 KV cache
KVDrive: A Holistic Multi-Tier KV Cache Management System for Long-Context LLM Inference Proc. ACM Manag. Data 2026 联合管理 GPU、Host DRAM、SSD 上的 KV 放置与流水线。

预印本与技术报告

以下工作与主题高度相关,但截至检索日期不能标为已在上述顶会正式发表。

论文 状态 主题关系 直接研究 KV cache
KVDirect: Distributed Disaggregated LLM Inference arXiv,2025 以 Tensor-centric metadata、GPU RDMA 和 pull-mode 直接跨节点获取 Prefill KV。
MemServe: Context Caching for Disaggregated LLM Serving with Elastic Memory Pool arXiv,2024 用分布式弹性 MemPool 统一 Context Caching 与 P/D 解耦。
LMCache: An Efficient KV Cache Layer for Enterprise-Scale LLM Inference arXiv/项目技术报告,2025 在 GPU、CPU、磁盘、对象存储和网络间提供独立 KV cache 层及控制 API。
TraCT: Disaggregated LLM Serving with CXL Shared Memory KV Cache at Rack-Scale arXiv,2025 让 GPU 通过 CXL load/store/DMA 直接读写机架级共享 KV,绕过 NIC hop。
Tutti: Making SSD-Backed KV Cache Practical for Long-Context LLM Serving arXiv,2026 以 GPU-centric object store 和 GPU io_uring 移除 SSD↔HBM KV 数据及控制关键路径中的 CPU。
DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference arXiv,2026;作者标注 to appear at ICDCS 2026 结合 page-cache 与 NVMe-direct 双路径,旁路文件系统并重叠 I/O 与 GPU DMA。
DAK: Direct-Access-Enabled GPU Memory Offloading with Optimal Efficiency for LLM Inference arXiv,2026 让 TMA 异步从远端内存直接取回卸载的 KV/权重至 GPU SMEM。
Serving Large Language Models on Huawei CloudMatrix384 arXiv 技术报告,2025 包含 P/D 分离、RDMA-plane KV 传输、UB 分布式 DRAM/SSD Context Caching 和 AIV-Direct。 是;但 AIV-Direct 本身不是 KV 路径

InstInfer 与 InstAttention

InstInfer: In-Storage Attention Offloading for Cost-Effective Long-Context LLM Inference 是 2024 年预印本名称;正式进入 HPCA 2025 时题名为 InstAttention。检索时应将二者视为同一工作演化,避免重复计数。

设计路线

  1. 显存内管理:PagedAttention 解决块分配和碎片;Keyformer、KIVI、QUEST、ALISA、LServe 通过选择、稀疏或量化降低常驻容量和读取带宽。
  2. 跨请求复用:Prompt Cache 和 PagedAttention 处理前缀或显式模块;CacheBlend、CacheSlide、ContextPilot、DroidSpeak 把复用扩展到非前缀、位置变化或跨模型场景。
  3. 分层存储:CachedAttention、IMPRESS、Mooncake、Strata、SolidAttention、KVDrive 在 HBM、DRAM、SSD 之间管理生命周期、淘汰和预取。
  4. P/D 解耦与网络传输:DistServe、Splitwise 奠定架构;DéjàVu、CacheGen、HACK、KVDirect、KVServe、DualPath、KVCodec 优化 KV 跨阶段移动。
  5. 直连与近数据处理:DirectKV 直接访问 CPU 内存;HiFC 使用 GPU Direct Storage;InstAttention 在 CSD 内执行 Attention;TraCT 使用 CXL 共享内存;Turbo 使用网络内聚合。

建议阅读顺序

  1. 先读 PagedAttention,理解 KV block、碎片和批处理容量。
  2. 再读 DistServe/Splitwise,理解为什么 P/D 解耦会制造 KV 传输问题。
  3. CacheGen、Mooncake、Strata,分别观察压缩传输、生产级分布式缓存、层级缓存与调度。
  4. 如果关注“直驱”,并列阅读 KVDirect、DirectKV、HiFC、InstAttention、TraCT、Tutti、DAK、CloudMatrix384,逐一确认数据路径绕过的是 CPU、Host DRAM、SDMA、NIC 还是 GPU staging buffer。

参考入口

评论