主页 › 范文 › 计算机 › 本文

DeepSeek-R1: 大语言模型强化学习

摘要

文章介绍了DeepSeek团队的第一代推理模型DeepSeek-R1-Zero和DeepSeek-R1。DeepSeek-R1-Zero通过大规模强化学习(RL)训练,无需监督微调(SFT)作为前置步骤,展现了强大的推理能力。然而,该模型在可读性和语言混合方面存在挑战。为此,DeepSeek团队进一步提出了DeepSeek-R1,通过引入多阶段训练和冷启动数据,显著提升了推理性能。DeepSeek-R1在推理任务上的表现与OpenAI-o1-1217相当。为支持研究社区,公布了开源DeepSeek-R1-Zero、DeepSeek-R1以及基于Qwen和Llama的六个蒸馏模型(1.5B、7B、8B、14B、32B、70B)

1. 引言

近年来,LLM 在自然语言处理(NLP)任务中取得了巨大进展。然而,提升 LLM 的推理能力通常需要 大量高质量监督数据,这不仅增加了数据收集成本,还限制了模型的泛化能力。

2. DeepSeek-R1-Zero:强化学习驱动的 LLM 进化

2.1 研究动机

传统的post-training依赖SFT进行冷启动,以增强模型的推理能力。然而,收集大规模高质量监督数据耗时且成本高。DeepSeek-R1-Zero 旨在探索 无监督数据的RL训练方法,验证 LLM 是否可以自行探索复杂的推理链(CoT)。

2.2 训练方法

DeepSeek-R1-Zero 采用 纯 RL 进行 post-training,训练过程中采用 群体相对策略优化(GRPO),并设计基于规则的奖励机制:

  • Accuracy rewards: 评估模型的输出是否正确。
  • Format rewards: 强制模型在推理过程中遵循特定格式,以规范推理链。

其目标函数可以表示为:

\[ R = R_{\text{accuracy}} + R_{\text{format}} \]

此外,DeepSeek-R1-Zero 通过 自我进化(Self-Evolution) 机制,不断优化自身推理策略,并在训练过程中自发涌现了一些高级智能行为,如:

  • Reflection(反思): 模型能够回顾并优化自己的推理过程。
  • Aha Moment(顿悟时刻): 模型在训练过程中突然发现新的问题解决方法。

2.3 训练成果

实验结果表明,DeepSeek-R1-Zero 在 AIME2024、MATH-500 等多个 Benchmark 上超越了 OpenAI-o1-0912,证明了 LLM 具备在 无监督数据的情况下,自主探索复杂推理链的能力。

3. DeepSeek-R1:强化学习 + 监督数据的优化方案

3.1 研究动机

DeepSeek-R1 结合 少量高质量 SFT 数据进行冷启动,以加速收敛并优化推理可读性。

3.2 训练方法

DeepSeek-R1 采用三阶段优化策略:

  1. 冷启动微调: 使用少量高质量 CoT 数据进行预训练。
  2. 基于 RL 的推理优化: 采用强化学习优化推理,并引入 语言一致性奖励:

\[ R = R_{\text{accuracy}} + R_{\text{format}} + R_{\text{language\_consistency}} \]

  1. 拒绝采样 + 监督微调: 结合 80 万条精选数据继续进行 SFT 训练。

4. 端侧模型优化:蒸馏优于强化学习?

4.1 研究发现

研究发现,基于 DeepSeek-R1 进行 蒸馏(Distillation)训练的小模型,性能明显优于直接进行强化学习:

  • 仅使用 SFT 进行蒸馏训练的小模型,性能优于 GPT-4o-0513。
  • 直接对小模型应用 RL 训练,效果不如蒸馏模型。

5. 结论与展望

本研究分析了 DeepSeek-R1 系列模型的训练方法和创新点,发现:

  1. DeepSeek-R1-Zero 证明了 LLM 可在无监督数据情况下自主探索推理能力。
  2. DeepSeek-R1 结合少量高质量 SFT 进行冷启动,并优化 RL 训练,提高推理能力和可读性。
  3. 蒸馏比 RL 更适合端侧小模型,但 RL 仍有潜在优化空间。

这一系列研究表明,强化学习可以成为 LLM 训练的新范式,未来可进一步探索 RL 在蒸馏模型上的优化方法。

相关论文