本文提出L2A框架,将大语言模型推理建模为输入和运行时资源预算共同约束的分配问题。通过引入轻量级门控网络,联合优化性能、一致性和资源成本,实现层跳过、头剪枝和推理token减少三个维度的自适应。单一模型即可覆盖整个计算-准确率帕累托前沿,在稀疏度高达34%时仍接近密集基线性能,远超静态或启发式基线。

核心观点

技术要点

该方法利用轻量级门控网络,这些门控根据当前输入和运行时资源预算(如可用内存、计算能力、延迟要求)动态决定是否跳过特定层、剪枝注意力头或减少推理生成的token数量。门控通过一个统一的损失函数进行训练,该损失函数结合了任务性能、逻辑一致性和资源成本。训练过程中,模型学习在不同资源约束下做出最优的稀疏化决策,从而实现从密集到高度稀疏的平滑自适应。

应用场景

适用于云环境中资源动态变化的LLM推理场景,如使用抢占式实例的分布式推理、根据用户服务质量分级提供差异化推理速度、以及在边缘设备上根据可用计算资源调整模型大小。