← 返回 2026-10-05 简报

面向异构多智能体大语言模型的免预填充跨家族KV缓存迁移

Prefill-Free Cross-Family KV Cache Transfer for Heterogeneous Multi-Agent LLMs

语音播报
摘要
事件:研究团队提出HeteroFold方法,实现Llama、Qwen等异构大模型间免预填充的跨家族KV缓存直接迁移与共享。 要点:该方法对齐不同分词器和架构层,将发送者状态映射至接收者空间并校准,在32K上下文中传输速度提升10.7倍。 影响:打破模型家族壁垒,使异构多智能体系统无需重复计算即可复用上下文,显著降低长文本处理成本并提升效率。

不同模型家族的LLM能否直接共享KV缓存,而无需接收端进行预填充?

我们的答案是HeteroFold。

我非常兴奋能分享我们的新论文:《面向异构多智能体LLM的免预填充跨家族KV缓存传输》!

近期关于免预填充KV缓存传输的研究表明,LLM可以重用之前计算好的上下文,而不是反复在接收端执行预填充操作。然而,现有方法主要集中于同一模型家族内或具有兼容分词器的模型。

我们提出了HeteroFold,这是一种用于免预填充跨家族KV缓存传输的方法,使得Llama、Qwen和Ministral等模型尽管在分词器、模型深度、KV结构和表示空间上存在差异,仍能直接共享KV缓存。

HeteroFold在不同分词器之间对齐令牌,并在不同架构的层之间进行对齐,将发送端的K/V状态映射到接收端的表示空间中,并校准传输后的缓存以保留接收端的注意力模式和输出。发送端和接收端均保持冻结状态,而学习到的映射关系允许接收端直接从传输后的缓存中解码,无需再次处理原始上下文。

在32K上下文长度下,HeteroFold的传输速度比原生接收端预填充快约10.7倍。我们评估了Llama、Qwen和Ministral之间所有六种传输方向的结果,在长上下文、短上下文和多智能体设置中均取得了优异表现。

最令我兴奋的是使KV缓存能够跨模型家族边界复用的可能性。与其让不同的LLM反复重新计算相同的上下文,异构模型可以直接彼此重用计算结果。

本条评分 9.8 score-v1
  • 来源权威 9
    注册表 priority=9(HuggingFace Daily Papers)
  • 时效 0.772
    发布 70.5 小时前,衰减到 0.77/3.0
  • 多源印证 0
    只有 1 家在报(无旁证)
  • 社区信号 0
    无社区数据(本管线走 RSS,HN 的 hn_fetcher 未接入)

首次收录 · 2026-10-05 · 9.77 分

原文链接:https://huggingface.co/papers/2609.32259
来源:HuggingFace Daily Papers
以上内容由 AI 自动翻译,仅供参考。
← 返回简报