40 · DeepSeek-R1: 强化学习驱动的推理革命

国产里程碑 推理 DeepSeek · 2025.01
DeepSeek-AI · arXiv:2501.12948

上一代的问题:推理能力依赖人类标注的思维链数据 —— 扩展性差、受限于人类认知模式,性能天花板被人工标注质量锁死。DeepSeek-V3 虽然架构领先但推理仍需 SFT。

这代改了什么:提出两条路线:
R1-Zero:从 V3-Base 直接做纯 RL(零 SFT),仅用规则奖励(答案正确 + 格式),让模型自主涌现推理行为
R1:冷启动 SFT + 多阶段 RL(GRPO + 规则奖励 + 语言一致性奖励 + 奖励模型)

效果:AIME 2024 达 79.8%(超 OpenAI o1 的 79.2%),MATH-500 达 97.3%。1.5B 蒸馏模型超越 GPT-4o。训练仅 $294K 成本。引爆全球开源社区。

一、核心背景

2024年底,推理能力被视为闭源模型的核心壁垒。OpenAI o1 系列证明了"慢思考"的价值,但技术细节不公开。主流认为推理能力需要大量人工标注的思维链数据进行 SFT。

DeepSeek 的核心洞察是:预训练 checkpoint 已经蕴含了推理潜力,关键是设计正确的 RL 激励信号来激发它。

二、核心创新

2.1 GRPO (Group Relative Policy Optimization)

Ai = (ri - mean({r1, ..., rG})) / std({r1, ..., rG})
GRPO 优势估计:每组 G=16 个采样输出,组内归一化代替 Critic 模型

PPO 需要同体量的 Value Model 来估计优势(GAE),GRPO 彻底舍弃 Critic——对每个问题采样 G 个输出,以组内奖励的均值和标准差作为基线。这是从 DeepSeekMath 延续下来的核心算法创新。

2.2 R1-Zero:纯 RL 的"Aha Moment"

从 DeepSeek-V3-Base 开始,不做任何 SFT,直接跑 GRPO。训练过程中,模型自主涌现出复杂推理行为:自我反思、验证、回溯探索。训练中期出现明显的"Aha Moment"——模型开始频繁使用 "wait" 标记来检查自己的推理问题(反思词汇量增长 5-7 倍)。

指标初始值最终值提升
AIME 2024 (pass@1)15.6%77.9%+62.3pp
AIME 2024 (cons@64)--86.7%超人类平均
MATH-500--95.9%接近完美

三、R1 完整训练管线

3.1 四阶段流程

DeepSeek-V3-Base (671B MoE, 37B active)
    │
    ├── R1-Zero: GRPO纯RL → 10400步
    │
    ├── 冷启动SFT: 数千条R1-Zero的精选CoT轨迹(人工润色)
    │
    ├── Stage 1 RL: GRPO + 规则奖励 + 语言一致性奖励
    │
    ├── Rejection Sampling → 800K SFT数据
    │   ├── 600K 推理(数学、代码、STEM、逻辑)
    │   └── 200K 非推理(写作、QA、翻译)
    │
    └── Stage 2 RL: GRPO + 混合奖励 1700步
        ├── 前1300步: 规则+语言一致性
        └── 后400步: + Helpfulness/Safety RM

3.2 奖励设计

四、关键结果

基准R1o1-1217GPT-4oClaude-3.5-Sonnet
AIME 202479.879.29.316.0
MATH-50097.396.474.678.3
MMLU90.891.887.288.3
GPQA Diamond71.560.049.965.0
LiveCodeBench65.963.432.938.9
SWE Verified49.248.938.850.8
AlpacaEval 2.087.657.851.152.0

4.1 蒸馏效果

蒸馏模型AIME 2024MATH-500
Distill-Qwen-1.5B28.983.9
Distill-Qwen-7B55.592.8
Distill-Qwen-32B72.694.3
Distill-Llama-70B70.094.5

1.5B 蒸馏模型在 AIME 上 28.9% 超越 GPT-4o 的 9.3%(3x),蒸馏 > 直接在小模型上做大规模 RL。

五、工程影响

六、上下游关联

上一篇:DeepSeek-V3 (2024.12) — 671B MoE 基础模型,R1 的训练起点

下一篇:DeepSeek-V4 (2026.04) — CSA/HCA 混合注意力,1M 上下文

并行工作:Kimi K2 (2025.04) — MuonClip 优化器 + Agent RL,SWE-bench 65.8%

七、个人思考

R1 最重要的贡献不是某个具体指标,而是证明了"纯 RL 激发推理"的可行性。这打破了"推理必须人类教"的范式——模型可以自己学会"停下来思考、反思、验证"。GRPO 的简洁性(无 Critic)让大规模 RL 变得切实可行,后续 K2、DeepSeek-Prover 等均沿用此框架。

另一个关键洞察是蒸馏的效果远超在小模型上直接做 RL——1.5B 模型靠蒸馏就能超越 GPT-4o 的推理能力。这意味着"推理能力一旦在大型模型涌现,就可以高效传递给小模型"。