文章提出教学对齐推理框架Pedagogy-R1,解决大型推理模型(LRM)在教育场景缺乏教学一致性的问题。通过蒸馏流程过滤模型输出构建指令微调数据,结合平衡教育基准(WBEB)评估学科知识、教学法、知识追踪等五大维度,并设计教学链(CoP)提示引导教师风格推理。实验表明:7B模型在教学决策任务准确率达54.76%,较基准提升31.34%;CoP提示使元认知代码增长3倍,降低冗余推理标记65%。该框架为教育大模型提供首个系统性教学能力评估方案。
当前教育大模型侧重内容生成,缺乏真实教学行为对齐。人类教师依赖教学理论与专业判断设计指导策略,而模型推理过程不可追溯且教学基准单一。文章提出Pedagogy-R1框架,通过教学对齐蒸馏与结构化评估基准,将大型推理模型(LRM)适配教育场景。核心创新包括:1) 基于QwQ-32B生成教学对齐的指令微调数据;2) 覆盖五大维度的平衡教育基准(WBEB);3) 教学链(CoP)提示策略引导教师式推理。
采用蒸馏式指令微调:使用WBEB 80%数据输入教师模型(QwQ-32B)生成响应,经正确性过滤保留1,948个高质量样本。以此微调1.5B/7B学生模型,生成Pedagogy-R1系列。关键公式:
\[ D_{\text{filtered}} = \{(x_i,y_i) \mid \text{Correct}(y_i)=\text{True}\} \]
对比实验组仅使用问题-答案对微调,验证教学推理数据的有效性。
CoP提示将通用推理指令(如"逐步推理")转化为教学感知指令,例如:"基于学生认知水平设计阶梯式反馈"。该策略应用于两阶段:1) 教师模型数据生成时产生教学富响应;2) 推理时引导模型分步输出教学决策逻辑。人工评估优先选择能清晰表达脚手架策略、形成性反馈的提示模板。
WBEB包含五大维度:1) 学科知识(CJ-Eval中学试题);2) 教学知识(韩国教师资格考题);3) 知识追踪(DBE-KT22编程学习序列);4) 作文评分(Kaggle开放数据集);5) 课堂决策(NCTE小学课堂实录)。总计12个子数据集,涵盖多语言、多学科真实教育场景。
Pedagogy-R1-7B在WBEB展现均衡优势:教学决策(DM)准确率54.76%、教学知识(PK)31.67%、作文评分(AES)15.83%,较普通指令微调模型分别提升31.34%、6.49%、8.75%。知识追踪(KT)AUC达54.99%,表明教学对齐显著增强教育任务泛化能力。7B模型在特殊教育子任务准确率37.5%,验证小模型教学适配性。
CoP提示使元认知代码增长3倍:自我质疑(IA-SQ)和元评估(OA-ME)在历史教育任务中占比从0%升至12%。定量显示:1) 学科知识任务错误响应伴随冗余标记增长,CoP提示降低冗余率41%;2) 数学科学任务规划代码(IA-P)占比达38%,反映学科特性;3) 65%推理标记为重复性噪声,CoP蒸馏压缩后效率提升。
框架揭示三大方向:1) 增强元认知审计机制,链接评估模型与批判模型;2) 开发学科定制化推理支架,数学侧重步骤规划,人文强化比较判断;3) 扩展多模态教学对齐,整合课堂视频与传感器数据。Pedagogy-R1为AI教育提供可解释的教学决策基础。