强化学习与可验证奖励(RLVR)显著提升了大型语言模型的推理能力,但存在推理模式不良可读性和语言混杂等兼容性问题。串联训练范式通过冻结的较弱初级模型与较强高级模型共同生成推理并作为团队获得奖励,迫使高级模型以初级模型可遵循的方式推理。本文提出串联强化学习(TRL),将串联训练引入RLVR,高级与初级模型随机交替共同生成推理,并应用标准GRPO损失。在竞赛数学任务上,TRL在独立推理能力上与标准GRPO相当,同时提升了交接鲁棒性、减少了分布漂移,并生成了更易于初级模型理解的思维链,展示了在多模型通信和人类兼容性方面的实用价值。
核心观点
- RLVR提升了LLM推理能力,但导致可读性差和语言混杂等兼容性问题。
- 串联训练通过高级和冻结初级模型协作奖励解决兼容性,此前仅概念验证。
- TRL将串联训练扩展到RLVR,采用随机交替生成和GRPO损失。
- TRL在竞赛数学上匹配标准RLVR性能,并同时提升鲁棒性、减少漂移、提高可读性。
- 结果表明TRL在多模型通信和人类兼容性方面具有实际收益。
技术要点
TRL结合串联训练范式与GRPO(Group Relative Policy Optimization)损失,高级模型和冻结初级模型随机交替共同生成推理链,实现团队奖励驱动下的协同训练。
应用场景
竞赛数学推理、多模型协作系统、人机协作场景中的可解释推理。