随着大型语言模型(LLM)服务中输入长度的持续增长,KV缓存已成为AI基础设施的主要瓶颈,限制了GPU内存容量、服务并发性、缓存复用和分布式扩展能力。现有服务系统大多采用单一的KV缓存抽象,将KV缓存视为同质的令牌级内存块序列,并在注意力头部和服务场景中采用相似策略管理。本文观察到KV缓存的实用性在KV头部间高度结构化:不同头部具有不同的功能角色、注意力距离和运行时重要性。因此,并非每个头部、令牌范围或服务场景都需要完整的KV缓存。我们提出了RedKnot,一种面向LLM服务的头部感知KV缓存管理系统。RedKnot通过沿KV头部分解KV缓存,打破了传统的单一抽象,其中头部的重要性和有效注意力范围在不同服务场景中显著变化。这种头部级分解将KV缓存从单一的张量抽象转变为结构化的内存对象,使得RedKnot能够统一支持位置无关的KV复用、前缀KV压缩、热/冷KV分离和分布式KV放置,同时保持输出保真度并提高资源效率,无需模型重新训练或微调。RedKnot通过将KV缓存从单一、被动的运行时产物转变为动态、模型感知的运行时基础,为可扩展的LLM服务建立了新的AI基础设施基础。
核心观点
- 大型语言模型服务中KV缓存已成为瓶颈
- 现有系统采用单一KV缓存抽象,忽视了头部的多样性
- 不同KV头部具有不同的功能角色和重要性
- RedKnot沿KV头部分解缓存,实现结构化内存管理
- 支持位置无关复用、前缀压缩、热/冷分离和分布式部署
- 无需模型重新训练或微调即可提升资源效率
技术要点
RedKnot采用头部感知的KV缓存管理,通过分解注意力头部的KV缓存实现结构化内存对象,并利用SegPagedAttention优化分配和复用。该技术将KV缓存从单一同质的张量抽象转变为动态、模型感知的运行时基础,支持位置无关缓存复用、前缀KV压缩、热/冷分离以及分布式KV位置管理。
应用场景
['长上下文LLM服务中的高效KV缓存管理', '提升AI基础设施的可扩展性和资源利用率', '支持分布式推理场景中的KV缓存协调', '在不牺牲输出质量的前提下减少内存占用']