本文提出串联强化学习(TRL)方法,将串联训练范式引入基于可验证奖励的强化学习(RLVR)。在TRL中,一个更强大的资深模型与一个冻结的初级模型交替随机协作生成推理过程,并根据团队表现获得奖励。在数学竞赛任务上使用Qwen3-4B-Instruct进行训练,发现TRL在保持单独推理能力与标准GRPO相当的同时,展现了三项优势:与初级模型更强的交接鲁棒性、减少与初级模型的分布漂移、以及更易于初级模型理解的思维链。结果表明TRL为RLVR提供了一种有前景的路径,在多模型通信和人机兼容性方面具有实际收益。
核心观点
- 提出串联强化学习(TRL),结合可验证奖励,解决RLVR中推理模式特异化问题。
- 资深模型与冻结初级模型交替生成推理,以团队协作方式获得奖励。
- TRL在保持单独推理能力的同时,提高与初级模型的兼容性、减少分布漂移、增强思维链可读性。
技术要点
TRL采用资深模型与冻结初级模型随机交替生成推理,使用GRPO损失函数训练资深模型。在Qwen3-4B-Instruct上针对竞赛数学任务进行实验,验证了TRL的性能和兼容性优势。
应用场景
多模型协作场景、人类与AI协同推理、提升推理可读性、需要模型间通信或人机兼容性的应用。