上一代的问题:推理能力依赖人类标注的思维链数据 —— 扩展性差、受限于人类认知模式,性能天花板被人工标注质量锁死。DeepSeek-V3 虽然架构领先但推理仍需 SFT。
这代改了什么:提出两条路线:
① R1-Zero:从 V3-Base 直接做纯 RL(零 SFT),仅用规则奖励(答案正确 + 格式),让模型自主涌现推理行为
② R1:冷启动 SFT + 多阶段 RL(GRPO + 规则奖励 + 语言一致性奖励 + 奖励模型)
效果:AIME 2024 达 79.8%(超 OpenAI o1 的 79.2%),MATH-500 达 97.3%。1.5B 蒸馏模型超越 GPT-4o。训练仅 $294K 成本。引爆全球开源社区。
2024年底,推理能力被视为闭源模型的核心壁垒。OpenAI o1 系列证明了"慢思考"的价值,但技术细节不公开。主流认为推理能力需要大量人工标注的思维链数据进行 SFT。
DeepSeek 的核心洞察是:预训练 checkpoint 已经蕴含了推理潜力,关键是设计正确的 RL 激励信号来激发它。
PPO 需要同体量的 Value Model 来估计优势(GAE),GRPO 彻底舍弃 Critic——对每个问题采样 G 个输出,以组内奖励的均值和标准差作为基线。这是从 DeepSeekMath 延续下来的核心算法创新。
从 DeepSeek-V3-Base 开始,不做任何 SFT,直接跑 GRPO。训练过程中,模型自主涌现出复杂推理行为:自我反思、验证、回溯探索。训练中期出现明显的"Aha Moment"——模型开始频繁使用 "wait" 标记来检查自己的推理问题(反思词汇量增长 5-7 倍)。
| 指标 | 初始值 | 最终值 | 提升 |
|---|---|---|---|
| AIME 2024 (pass@1) | 15.6% | 77.9% | +62.3pp |
| AIME 2024 (cons@64) | -- | 86.7% | 超人类平均 |
| MATH-500 | -- | 95.9% | 接近完美 |
DeepSeek-V3-Base (671B MoE, 37B active)
│
├── R1-Zero: GRPO纯RL → 10400步
│
├── 冷启动SFT: 数千条R1-Zero的精选CoT轨迹(人工润色)
│
├── Stage 1 RL: GRPO + 规则奖励 + 语言一致性奖励
│
├── Rejection Sampling → 800K SFT数据
│ ├── 600K 推理(数学、代码、STEM、逻辑)
│ └── 200K 非推理(写作、QA、翻译)
│
└── Stage 2 RL: GRPO + 混合奖励 1700步
├── 前1300步: 规则+语言一致性
└── 后400步: + Helpfulness/Safety RM
Reward_lang = Num(target_lang) / Num(total),抑制中英混杂| 基准 | R1 | o1-1217 | GPT-4o | Claude-3.5-Sonnet |
|---|---|---|---|---|
| AIME 2024 | 79.8 | 79.2 | 9.3 | 16.0 |
| MATH-500 | 97.3 | 96.4 | 74.6 | 78.3 |
| MMLU | 90.8 | 91.8 | 87.2 | 88.3 |
| GPQA Diamond | 71.5 | 60.0 | 49.9 | 65.0 |
| LiveCodeBench | 65.9 | 63.4 | 32.9 | 38.9 |
| SWE Verified | 49.2 | 48.9 | 38.8 | 50.8 |
| AlpacaEval 2.0 | 87.6 | 57.8 | 51.1 | 52.0 |
| 蒸馏模型 | AIME 2024 | MATH-500 |
|---|---|---|
| Distill-Qwen-1.5B | 28.9 | 83.9 |
| Distill-Qwen-7B | 55.5 | 92.8 |
| Distill-Qwen-32B | 72.6 | 94.3 |
| Distill-Llama-70B | 70.0 | 94.5 |
1.5B 蒸馏模型在 AIME 上 28.9% 超越 GPT-4o 的 9.3%(3x),蒸馏 > 直接在小模型上做大规模 RL。
上一篇:DeepSeek-V3 (2024.12) — 671B MoE 基础模型,R1 的训练起点
下一篇:DeepSeek-V4 (2026.04) — CSA/HCA 混合注意力,1M 上下文
并行工作:Kimi K2 (2025.04) — MuonClip 优化器 + Agent RL,SWE-bench 65.8%
R1 最重要的贡献不是某个具体指标,而是证明了"纯 RL 激发推理"的可行性。这打破了"推理必须人类教"的范式——模型可以自己学会"停下来思考、反思、验证"。GRPO 的简洁性(无 Critic)让大规模 RL 变得切实可行,后续 K2、DeepSeek-Prover 等均沿用此框架。
另一个关键洞察是蒸馏的效果远超在小模型上直接做 RL——1.5B 模型靠蒸馏就能超越 GPT-4o 的推理能力。这意味着"推理能力一旦在大型模型涌现,就可以高效传递给小模型"。