大语言模型推理通常基于静态资源假设部署,但实际云基础设施资源动态变化。为解决此问题,提出L2A端到端框架,将推理建模为依赖于输入和运行时资源预算的分配问题。通过轻量级预算条件和输入感知的门控网络,联合优化性能、一致性和成本,沿跳层、头部剪枝、推理令牌减少三个轴动态调整计算。单个L2A模型在Llama-3-8B和Qwen-3-4B上覆盖计算-精度帕累托前沿,高稀疏度下保持接近密集基线的精度,而静态或启发式基线需单独调优且精度下降5-10%。
核心观点
- 提出L2A框架实现资源自适应LLM推理,同时考虑输入困难和资源预算
- 引入轻量级预算条件与输入感知的门控网络,动态跳过层、修剪头、减少推理令牌
- 统一优化目标平衡任务性能、逻辑一致性和资源成本
- 单个模型可覆盖整个计算-精度帕累托前沿,无需为不同资源水平单独调优
- 在多种模型上实现高稀疏度(如34%层稀疏)下精度损失小于0.6%
技术要点
L2A框架将推理建模为约束分配问题,条件包括输入和运行时资源预算。轻量级门控网络集成到LLM中,通过统一目标训练:任务性能(如交叉熵)、逻辑一致性(对比损失)和资源成本(稀疏正则化)。三个动态轴:层跳过应对内存/深度压力,头部修剪应对吞吐量竞争,推理令牌减少应对延迟收紧。门控网络采用低维特征(如隐藏状态统计和预算编码),通过强化学习或可微方法优化离散决策。模型端到端学习预算感知策略,实时调整计算图。
应用场景
['云推理服务中应对资源波动(如Spot实例抢占)和分级QoS', '资源受限设备(如移动端或边缘端)上部署LLM,动态平衡精度与效率', '多租户环境根据用户请求优先级分配计算资源', '需要高吞吐量或低延迟的场景中自适应减少计算冗余']