文章介绍了DeepSeek团队的第一代推理模型DeepSeek-R1-Zero和DeepSeek-R1。DeepSeek-R1-Zero通过大规模强化学习(RL)训练,无需监督微调(SFT)作为前置步骤,展现了强大的推理能力。然而,该模型在可读性和语言混合方面存在挑战。为此,DeepSeek团队进一步提出了DeepSeek-R1,通过引入多阶段训练和冷启动数据,显著提升了推理性能。DeepSeek-R1在推理任务上的表现与OpenAI-o1-1217相当。为支持研究社区,公布了开源DeepSeek-R1-Zero、DeepSeek-R1以及基于Qwen和Llama的六个蒸馏模型(1.5B、7B、8B、14B、32B、70B)
近年来,LLM 在自然语言处理(NLP)任务中取得了巨大进展。然而,提升 LLM 的推理能力通常需要 大量高质量监督数据,这不仅增加了数据收集成本,还限制了模型的泛化能力。
传统的post-training依赖SFT进行冷启动,以增强模型的推理能力。然而,收集大规模高质量监督数据耗时且成本高。DeepSeek-R1-Zero 旨在探索 无监督数据的RL训练方法,验证 LLM 是否可以自行探索复杂的推理链(CoT)。
DeepSeek-R1-Zero 采用 纯 RL 进行 post-training,训练过程中采用 群体相对策略优化(GRPO),并设计基于规则的奖励机制:
其目标函数可以表示为:
\[ R = R_{\text{accuracy}} + R_{\text{format}} \]
此外,DeepSeek-R1-Zero 通过 自我进化(Self-Evolution) 机制,不断优化自身推理策略,并在训练过程中自发涌现了一些高级智能行为,如:
实验结果表明,DeepSeek-R1-Zero 在 AIME2024、MATH-500 等多个 Benchmark 上超越了 OpenAI-o1-0912,证明了 LLM 具备在 无监督数据的情况下,自主探索复杂推理链的能力。
DeepSeek-R1 结合 少量高质量 SFT 数据进行冷启动,以加速收敛并优化推理可读性。
DeepSeek-R1 采用三阶段优化策略:
\[ R = R_{\text{accuracy}} + R_{\text{format}} + R_{\text{language\_consistency}} \]
研究发现,基于 DeepSeek-R1 进行 蒸馏(Distillation)训练的小模型,性能明显优于直接进行强化学习:
本研究分析了 DeepSeek-R1 系列模型的训练方法和创新点,发现:
这一系列研究表明,强化学习可以成为 LLM 训练的新范式,未来可进一步探索 RL 在蒸馏模型上的优化方法。