文章提出一种基于在线强化学习的框架,将大型语言模型转化为教学辅导模型。通过合成师生对话模拟替代人工标注数据,训练7B参数模型Qwen2.5-7B-RL。核心贡献包括:1) 设计双目标奖励函数,平衡学生解题准确率与教学原则遵循度;2) 引入惩罚权重λ实现教学支持与解题率间的帕累托优化;3) 结合思考标签提升模型决策可解释性。实验表明,该方法在数学辅导任务中匹配闭源模型LearnLM,且不损害基础推理能力。
大型语言模型在教育场景常被优化为直接提供答案,但有效教学需引导学生自主构建解决方案。现有方法依赖人工标注或静态数据,难以捕捉多轮教学动态。文章提出在线强化学习框架,通过模拟师生对话实现教学行为对齐。
构建基于BigMath数据集的师生交互环境:1) 随机分配学生发起或教师发起对话场景;2) 学生模型基于Llama-3.1-8B生成响应;3) 教师模型通过GRPO算法优化策略。环境设置强制教师避免答案泄露,仅允许苏格拉底式提问和针对性提示。
定义双目标奖励机制:1) 后对话解题率评估学生能力提升;2) 教学质量由多法官模型联合评估。二者通过参数λ动态平衡:
\[ r = r_{\text{sol}} + (r_{\text{ped}} - 1) \cdot \lambda \]
当λ增大时,模型更倾向遵循教学原则,但学生解题率下降。实验显示λ=0.75时达成最优帕累托平衡。
为增强可解释性,教师响应前生成结构化思考标签:
\[ \langle \text{think} \rangle \ldots \langle /\text{think} \rangle \]
该机制显式展示教学决策过程,提升8%的教学质量评分,同时维持解题能力。
在BigMath测试集上,Qwen2.5-7B-RL(λ=1.5)相比闭源模型LearnLM:1) 学生解题率提升19.7%;2) 答案泄露率仅5.4%;3) 教学评分达4.4/4.0。表明小模型可通过RL对齐匹配专有大模型。
在MMLU/GSM8K/MATH基准测试中:1) RL微调模型相对原始模型性能波动≤1.8%;2) 监督微调(SFT)导致数学任务下降9.4%。验证教学对齐不损害基础推理能力。
该框架首次实现无需人工标注的教学对齐,通过λ参数动态控制教学严格度。思考标签机制为模型决策提供透明化窗口。未来可扩展至多学科和多学生角色模拟,推动LLM教育应用发展。