随着大语言模型(LLM)服务输入长度的持续增长,KV缓存已成为AI基础设施中的主要瓶颈,限制GPU内存容量、服务并发性、缓存重用和分布式可扩展性。位置无关KV缓存、前缀KV缓存压缩、热/冷KV缓存分离以及分布式KV缓存管理等重要问题,均依赖于KV缓存的表示和管理方式。然而,现有服务系统大多采用统一的KV缓存抽象,将KV缓存视为同质化的token级内存块序列,并在注意力头和服务场景中采用相似策略进行管理。我们观察到,KV缓存的效用在不同KV头之间具有高度结构性:不同头表现出不同的功能角色、注意力距离和运行时重要性。因此,并非每个头、token范围或服务场景都需要完整的KV缓存。我们提出RedKnot,一种用于LLM服务的头感知KV缓存管理系统。RedKnot通过沿KV头分解KV缓存来打破传统的统一KV缓存抽象,这些KV头的重要性和有效注意力范围在不同服务场景中变化显著。这种头级分解将KV缓存从统一的张量抽象转变为结构化的内存对象,使RedKnot能够在保持输出保真度和提高资源效率的同时,统一支持位置无关的KV重用、前缀KV压缩、热/冷KV分离和分布式KV放置,无需模型重训练或微调。RedKnot通过将KV缓存从统一、被动的运行时工件转变为动态、模型感知的可扩展LLM服务运行时基础,为AI基础设施建立了新基础。

核心观点

技术要点

RedKnot的核心技术包括头感知KV分解(head-aware KV decomposition)和SegPagedAttention。头感知分解将KV缓存按注意力头维度拆分,每头独立管理,从而根据头的重要性、有效注意力范围和服务场景动态调整缓存策略。SegPagedAttention是一种分页注意力机制,支持高效的位置无关KV块重用和压缩。系统利用头级重要性评分实现热/冷分离,并在分布式环境中智能放置KV缓存,同时通过前缀共享进一步压缩缓存。所有操作不改变模型架构,无需额外训练。

应用场景

['长上下文LLM服务(如文档问答、代码生成)中的KV缓存管理。', '高并发LLM推理场景下的内存优化和缓存重用。', '分布式推理系统中KV缓存的跨节点高效放置。', '需要前缀共享的批处理服务(如多轮对话、检索增强生成)。', '资源受限环境下的LLM推理加速(如边缘设备)。']