尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

【多轮对话论文导读(九)】教育领域大模型多轮对话论文调研:看 LLM Tutor 如何真正实现“会教”而不是“会答”

【多轮对话论文导读(九)】教育领域大模型多轮对话论文调研:看 LLM Tutor 如何真正实现“会教”而不是“会答” 本文围绕教育领域的LLM Multi-turn Dialogue Intelligent Tutoring展开调研重点分析三个核心问题教育多轮对话数据怎么构造模型如何根据学生当前状态决定下一轮应该怎么教如何评价一个模型“整段教学过程”是否优秀而不是只看某一句回答论文MathDial: A Dialogue Tutoring Dataset with Rich Pedagogical Properties Grounded in Math Reasoning Problems, EMNLP 2023EduDial: Constructing a Large-scale Multi-turn Teacher-Student Dialogue Corpus, EMNLP 2026Planning-Guided Tutoring with Assessment-Driven Memory for Pedagogical LLM Tutors (ScaffoldLM), ACL 2026这三篇论文实际上形成了一条非常清晰的技术演进路线MathDial先解决“有没有好的多轮教育数据”↓EduDial进一步解决“教师应该什么时候问、问什么、针对什么学生问”↓ScaffoldLM进一步解决“模型如何在真实多轮过程中持续维护教学计划和学生认知状态”1.导读普通的多轮对话可以把问题理解成User: 问题1 Assistant: 回答1 User: 问题2 Assistant: 回答2模型只需要保证理解历史上下文回答当前问题不要忘记之前的信息。但教育场景完全不同一个优秀的 Tutor 并不是学生问什么 → 教师回答什么而是学生当前状态 ↓ 教师判断学生哪里不会 ↓ 决定下一步教学策略 ↓ 提出问题 / 给提示 / 举例 / 纠错 ↓ 学生再次回答 ↓ 重新判断学生状态 ↓ 决定下一步教学策略 ↓ ……因此教育多轮对话本质上更接近是一个Partially Observable Sequential Decision Process可以简单写成其中学生在第 t 轮的状态教师在第 t 轮采取的教学动作学生产生的下一轮响应教师根据学生响应推断出的新状态。因此真正需要优化的不是而更接近其中历史对话学生当前状态最终教学目标。这也是为什么教育领域的多轮对话研究越来越从“response generation”走向state modeling action selection trajectory optimization所以一个好的教育 Agent 最重要的能力包括Memory记住学生过去的学习状态Planning提前制定教学计划Personalization针对不同学生调整教学Multi-Agent Communication可以用 Teacher / Student / Critic 等不同 Agent 模拟教学过程。2. MathDial——教育多轮数据从哪里来MathDial: A Dialogue Tutoring Dataset with Rich Pedagogical Properties Grounded in Math Reasoning ProblemsEMNLP Findings 2023官方 GitHubMathDial论文的核心观点非常简单LLM 会做数学题 ≠ LLM 会教数学。论文指出GPT-3 一类模型虽然能够解决数学问题但作为 Tutor 时容易给出错误反馈直接告诉学生答案没有真正引导学生自己思考这篇论文认为教育对话需要额外包含学生哪里错学生为什么错教师采取什么教学策略教师什么时候应该给提示什么时候应该让学生自己思考什么时候才应该告诉答案2.1 MathDial 的数据构造方法整体流程GSM8K 数学题 ↓ 正确 solution ↓ 构造学生错误 / confusion ↓ LLM 模拟学生 ↓ Human Teacher ↓ 多轮教学 ↓ Teacher Move 标注 ↓ MathDial最终得到大约2,861 dialogues 91 teachers GSM8K math problems每段对话都是 1:1 teacher-student tutoring dialogue。2.2 Student Simulator他们不是简单让 LLM 生成回答而是给学生模型更加具体的信息Problem Correct Solution Student Profile Initial Confusion Dialogue History然后让 LLM 生成下一轮学生行为。Student Agent 不是随机生成用户而是在模拟一个带有错误状态的学生。system_promptstudent_prompt f You are a 6th-grade student. Problem: {problem} Your initial misconception: {confusion} Student profile: {student_profile} Dialogue history: {history} Respond as the student. Do not suddenly become an expert. 2.3 Teacher Move TaxonomyMathDial 将Teacher Response 进一步定义Focus 引导学生直接向当前问题前进。例如“Can you calculate ...?”Probing不直接告诉答案而是让学生自己思考。例如“Why do you think you need to add these numbers?”Telling直接告诉学生答案。例如“You need to add X to Y.” MathDial 的数据分析也发现教师在对话早期更倾向使用 scaffolding而随着对话推进Telling 的比例会增加。整个教育过程变成MathDial 主要把这种结构用于构造训练数据和 Tutor response generation。2.4 MathDial 如何训练 Tutor训练任务Dialogue History Student Current Response Optional Problem Solution ↓ Tutor Response即可以理解成一个条件语言模型context [ problem, dialogue_history, student_response ] teacher_response model.generate(context)然后通过 supervised fine-tuning 学习人类教师行为。官方仓库也直接提供了 SFT pipelinecd SFT_Finetuning python SFT_Finetuning.py并提供基于 Qwen2.5-1.5B-Instruct 的训练模型。2.5 MathDial 如何验证MathDial 的实验不是只看BLEU ROUGE而是分成几个层面。2.5.1 学生模拟质量让教师判断学生的错误是否像真实学生学生行为是否合理也就是说先验证 student simulator 本身是不是可信。2.5.2 Teacher Move 分析论文进一步统计Focus Probing Telling Generic发现教师主要使用Scaffolding而不是直接Telling尤其在前期。同时Focus Probing 合并之后标注一致性明显提高说明两个类别之间存在一定边界模糊。这其实给后面的教育 Agent 一个重要启发教育动作最好不要只有一个粗粒度的 action label。可以进一步设计Teacher Action ├── Focus │ ├── Seek Strategy │ ├── Guide Attention │ └── Recall Information │ ├── Probing │ ├── Ask Explanation │ ├── Self Correction │ ├── Perturb Question │ └── World Knowledge │ ├── Telling │ ├── Reveal Strategy │ └── Reveal Answer │ └── Generic2.5.3 进行真实的多轮 Interactive Evaluation论文除了单句预测评估还完整运行一个多轮 episode。然后评价① Student Solving Success学生最后能不能自己解决问题。② Solution TellingTutor 是否直接泄露答案。于是出现一个非常重要的 trade-off而更应该是这和普通 LLM benchmark 的思路完全不同。论文确认教师在约 89% 的对话中能够解决学生 confusion其中大部分通过 scaffolding而不是直接透露答案。2.6 MathDial 对多轮对话研究的启发MathDial 最重要的贡献不是“一个数学数据集”。而是提出了Student State ↓ Teacher Action ↓ Student Response ↓ Student State Update这实际上已经是Educational Dialogue as Sequential Decision Making但是它还有明显不足问题 1学生状态比较粗主要是confusion error profile没有特别精细的knowledge state misconception state confidence motivation mastery current goal问题 2Teacher Action 比较粗只有Focus Probing Telling Generic问题 3没有显式长期教学计划教师主要根据当前上下文进行响应。这就引出了第二篇论文。3. EduDial——解决“什么时候问、问什么、针对谁问”EduDial: Constructing a Large-scale Multi-turn Teacher-Student Dialogue CorpusEMNLP 2026EduDial GitHub这篇论文把问题向前推进了一步。MathDial教师应该采取什么教学动作EduDial教师应该在什么教学阶段对什么水平的学生采用什么提问策略普通 multi-turn benchmark 的问题Turn 1 Turn 2 Turn 3 ...只是要求模型“保持对话连贯。”但教育需要教学目标 ↓ 教学阶段 ↓ 学生认知水平 ↓ 当前状态 ↓ 提问策略 ↓ 学生响应 ↓ 下一阶段EduDial 明确指出两个问题问题 1什么时候问如果学生刚刚接触知识Teacher 为什么可能太早。如果学生已经理解Teacher 你知道这个概念吗又太简单。问题 2问什么不同阶段的问题应该不同。因此 EduDial 引入Blooms Taxonomy Five-stage Teaching Process16. EduDial 的五阶段教学过程整体Introduction ↓ Concept Exploration ↓ Deep Understanding ↓ Knowledge Application ↓ Reflection Summary对应 BloomRemember ↓ Understand ↓ Analyze ↓ Apply / Evaluate ↓ Create论文明确将这五个阶段作为控制多轮教学节奏的核心结构。3.1 不同阶段的 questioning strategy设计这是 EduDial 很关键的一点。它为不同阶段设计不同 questioning strategy。例如IntroductionContextual Questioning Retrospective Questioning激活已有知识。Concept ExplorationPredictive Questioning Verification Questioning帮助学生形成概念。Deep UnderstandingZPD Questioning Critical Questioning让学生进入更高阶思考。Knowledge ApplicationIntegrative Questioning Open-ended QuestioningReflectionSummary Questioning Metacognitive Questioning所以而不是这就是 EduDial 相比普通多轮 Dialogue 的关键升级。3.2. Student ProfileEduDial 不只区分student而是构造三个学生类型Excellent Medium Struggling并给每个学生定义cognitive capacitylearning motivationclassroom engagementlearning strategiesself-regulation然后教师策略分别变化。3.3. 三种学生对应三种教学策略Excellent重点Deep Exploration Progressive Questioning Higher-order Thinking教师不能一直问“你知道答案吗”而应该“如果改变这个条件会怎样”Medium重点Thinking Guidance Procedural Guidance ApplicationStruggling重点Confidence Building Foundational Cognition Gradual Knowledge Construction这就出现了一个非常重要的状态映射3.4. EduDial 的数据构造EduDial 最终构建345 Knowledge Points 34,250 Dialogue Sessions其数据主要包括两个部分EduDial ├── MTI │ └── Multi-turn Teaching Instruction │ └── PDTS └── Preference Dataset based on Teaching Strategies3.5. MTI让模型学会“怎么教”MTI 的核心是Teaching Syllabus Teaching Stage Student Profile Questioning Strategy输入 LLMprompt { knowledge_point: kp, stage: teaching_stage, student_profile: profile, strategy: questioning_strategy, dialogue_history: history }然后生成Teacher: ... Student: ... Teacher: ... Student: ...再通过GPT-4o verification Expert verification进行质量控制。论文明确采用 expert-machine dual verification检查教学阶段是否合理提问策略是否正确学生状态是否匹配知识是否正确对话是否自然。3.6. PDTS解决“不同学生应该选择什么策略”这是 EduDial 比 MathDial 更进一步的地方。它构造Instruction ↓ Chosen Response Rejected Response例如Student struggling Chosen: 用更基础的问题逐步引导 Rejected: 直接提出高难度开放性问题于是构造成D{(x,y,y−)}D \{(x,y^,y^-)\}其中xx教学上下文yy^正确教学策略y−y^-错误/不适合当前学生的策略。然后使用 DPO。3.7. EduDial 的 SFTSFT loss代码层面就是典型的 causal LMoutputs model( input_idsinput_ids, labelslabels ) loss outputs.loss loss.backward() optimizer.step()但是 EduDial 的关键不是 loss 本身。而是训练数据把“教学阶段 多轮历史 学生状态 教师动作”绑定在一起。因此模型学到的不是Question → Answer而是Student State Teaching Stage Dialogue History → Teaching Response3.8. EduDial 的 DPO论文使用其中代码可以理解为chosen_logp model_logprob( prompt, chosen_response ) rejected_logp model_logprob( prompt, rejected_response ) loss -torch.log( torch.sigmoid( chosen_logp - rejected_logp ) ) loss.backward() optimizer.step()DPO 的作用不是让模型“更聪明”。而是让模型学会在当前学生状态下哪一种教学行为更合适。这点非常重要。3.9. EduDial 的 11 维评价体系这是这篇论文对你研究“多轮对话 evaluation”最有价值的部分之一。论文没有简单使用BLEU ROUGE BERTScore而是设计Overall Quality9 个指标Insight Response Feedback Thinking Interactivity Emotional Support Adaptability Fluency GoalContent Quality2 个指标Relevance Coverage为什么这个评价方式比 BLEU 更适合教育因为教育没有唯一正确回答。例如Teacher A: 你能想想第一步应该做什么吗 Teacher B: 如果先把左边整理一下你觉得会发生什么 Teacher C: 先不要算看看这个式子中未知数的位置。三个回答都可能是优秀的。所以LLM evaluation 应该从what / where / how三个维度考虑而不能把单一文本相似度指标当成完整能力评价。3.10. EduDial 的实验设计训练137 training chapters 275 knowledge points测试36 chapters 70 knowledge pointsMTI13,700 dialogues 平均 11 roundsPDTS20,550 preference pairsMulti-student Evaluation它甚至不是只测试Teacher ↔ Student而是┌── Excellent Student Teacher ─────────┼── Medium Student └── Struggling Student最多 15 rounds。同时还进行 one-on-one evaluation。这非常重要因为它开始接近真实课堂一个 Teacher 同时面对多个不同认知水平的 Student。EduDial 的结果EduDial-LLM 在机器评价中的 Overall Quality 平均达到4.474.47人工评价4.364.36在 11 个维度上总体表现最好。尤其Insight 4.58 Feedback 4.62 Thinking 4.55 Interactivity 4.64 Adaptability 4.60 Goal 4.56ContentRelevance 4.83 Coverage 91.83%最有价值的是 Ablation论文做了Base Model Base SFT Base DPO Base SFT DPO结果Base ↓ SFT ↓ DPO ↓ SFT DPO完整模型最好。特别是SFT主要让模型学会教学流程和提问方式DPO进一步提高 adaptability / thinking 等复杂教学能力。因此可以得到一个很清晰的结论3.11. EduDial 的局限论文自己也明确指出① Teacher-led目前主要是Teacher → Student未来需要Student主动提问 Student主动表达困惑 Student挑战教师② 主要是文本没有充分利用图片 语音 视频 板书 数学公式所以 EduDial 更像把“教育多轮对话”结构化了。但还没有真正解决长期教学过程中学生状态如何动态演化。4. ScaffoldLM——真正开始建模“教学轨迹”Planning-Guided Tutoring with Assessment-Driven Memory for Pedagogical LLM TutorsACL 2026ScaffoldLM GitHub论文直接指出现有 Tutor 的两个问题。问题 1没有显式 Pedagogical Planning以前模型学生说一句 ↓ LLM 生成一句 ↓ 学生说一句 ↓ LLM 再生成一句没有我要先教 Step 1 然后 Step 2 然后 Step 3于是很容易教学逻辑漂移 ↓ 重复 ↓ 跳步骤 ↓ 提前泄露答案问题 2没有 Cognitive State Tracking学生说我觉得应该减去 3。教师真正需要判断的是correct? incorrect? confused? misconception? question? understood?但普通 LLM 可能直接很好我们继续。然后继续生成。也就是说没有真正经过4.1. ScaffoldLM 的核心思想它把 Tutor 拆成┌────────────────────┐ │ Pedagogical Plan │ └─────────┬──────────┘ ↓ Student Response → Assessment → State ↓ Memory Update ↓ Action Select ↓ Tutor Response ↓ Student也就是PlanMemoryAssessment→Action\boxed{ Plan Memory Assessment \rightarrow Action }论文明确提出Stepwise Pedagogical Plan Assessment-Driven Memory4.2. Stepwise Pedagogical Plan假设Solve: 2x 3 9模型不是直接生成x 3而是先生成Step 1: 2x 6 Question: How can we isolate 2x? Answer: Subtract 3 from both sides. Step 2: x 3 Question: What should we do next to isolate x? Answer: Divide both sides by 2.形式化其中qtq_t当前教学问题ata_t对应参考答案。论文明确这样定义 pedagogical plan。为什么一定要提前 Planning因为普通 LLM Turn 1 → 自由生成 Turn 2 → 自由生成 Turn 3 → 自由生成容易产生Strategy Drift而 ScaffoldLMPlan: q1 → q2 → q3 → q4每一轮只关注Current Step所以这和 Agent Planning 的思想非常类似。4.3. Assessment-Driven Memory这是 ScaffoldLM 最核心的部分。它的 memory 不只是history [...]而是memory { plan: plan, progress: progress, learner_state: state, dialogue_history: history }论文将 progress 表示成例如Step 1 completed Step 2 completed Step 3 not completed Step 4 not completed就是progress [1, 1, 0, 0]4.4. Learner StateScaffoldLM 对学生状态进一步细化Start Correct Incorrect Question Comprehension Confusion Irrelevant End于是教师每轮首先做state assess(student_response)而不是马上response generate(student_response)4.5. ScaffoldLM 的四步循环整个系统可以理解成1. Assess ↓ 2. Act ↓ 3. Track ↓ 4. Record ↓ 下一轮即然后这就已经非常接近一个完整的 trajectory model。4.6. ScaffoldLM 的核心伪代码如果把论文实现思想写成 Pythondef tutoring(problem, learner): plan build_pedagogical_plan(problem) memory { plan: plan, progress: [0] * len(plan), history: [], state: start } while True: student_response learner.respond( memory[history] ) # 1. Assess state assess_student( student_response, memory ) # 2. Determine current step step_id get_current_step( memory[progress] ) # 3. Select tutoring action action select_action( statestate, stepplan[step_id], memorymemory ) # 4. Generate tutor response tutor_response generate_response( actionaction, statestate, current_stepplan[step_id], historymemory[history] ) # 5. Update progress memory[progress] update_progress( memory[progress], state, step_id ) # 6. Record trajectory memory[history].append({ student: student_response, state: state, action: action, teacher: tutor_response }) if finished(memory): break注意这不是论文仓库中的逐字源码而是根据论文方法抽象出的等价实现结构。论文官方代码则把这个框架进一步拆成data_synthesis/ ├── planning/ │ ├── generate_plan.py │ ├── rule_filter.py │ ├── model_filter.py │ └── pipeline.py │ ├── tutoring/ │ ├── generate_dialogues.py │ ├── dialogue_filter.py │ └── pipeline.py │ └── model_serving/ ├── structured_tutor.py └── interactive_cli.py4.7. ScaffoldLM 更重要的是它把数据生成也结构化普通 synthetic dialogueLLM: 模拟一个学生 LLM: 模拟一个老师 生成一堆数据问题是Student Agent 和 Teacher Agent 可能根本没有对齐。例如Student 我不理解。 Teacher 很好你已经掌握了这个概念。这显然是错误的监督信号。4.8. ScaffoldLM 的 Consistency-Enforced Data Synthesis它采用Pedagogical Plan ↓ Learner Agent ↓ Target Student State ↓ Tutor Agent ↓ Assessment ↓ 是否与 Target State 一致 ↓ Yes → 保留 No → 重新生成 Student才保留这一轮。论文把这一机制称为Consistency-Enforced Data Synthesis这点对“学生模拟器”研究非常重要。一个普通训练样本Input: 学生说我认为答案是 10。 Output: 你再想想。信息非常少。ScaffoldLM 实际上可以变成{ problem: ..., current_step: 2, student_response: 我认为答案是10, student_state: incorrect, target_state: incorrect, teacher_action: reask, teacher_response: 你检查一下第二步的计算。, progress: [1, 0, 0] }4.9. ScaffoldLM 数据生成规模作者从 BigMath 中选择10,000 training problems 300 held-out problems经过 planning filter7,353 valid plans 5,635 high-quality planning samples进一步生成 tutoring trajectories5,844 dialogues 49,815 turns 平均 8.5 turns4.10. Student State Sampling它在生成训练对话时显式采样学生状态。概率Correct 0.50 Incorrect 0.20 Question 0.10 Comprehension 0.10 Confusion 0.05 Irrelevant 0.05这意味着学生不再是一个随机用户而是一个可控状态机。4.11. ScaffoldLM 如何训练最终得到Planning SFT Data Tutoring SFT Data训练 Qwen2.5-7B-Instruct。主要设置Full-parameter fine-tuning 2 epochs BF16 12,288 max sequence length FlashAttention 2 8 × A800 80GB DeepSpeed ZeRO-3 Global batch size 64 LR 1e-54.12 ScaffoldLM 的 Evaluation这是三篇论文里最完整的多轮 evaluation 之一。它评价Pedagogical Ability六个维度Answer Accuracy Stepwise Scaffolding Topic Adherence Question Quality Guidance Quality Adaptive Feedback其中前五个通过Tutor ↕ Learner Simulator进行多轮交互。Adaptive Feedback Evaluation另外构造Correct Incorrect Question三类学生状态。每类70 samples总共210210然后让 Tutor 根据Dialogue History Student State生成响应。再判断这个 response 是否真的适配当前学生状态Solution Leakage Evaluation这是非常值得借鉴的指标。因为一个 Tutor 很容易通过直接告诉答案让学生最后做对。但这不代表学会了。所以 ScaffoldLM 同时测ΔSolveRate\Delta SolveRate以及LeakageRateLeakageRate即学生最终做对了多少和教师有没有直接泄露答案这比单纯 accuracy 更符合教育场景。4.13. ScaffoldLM 实验结果结果非常有意思。ModelAnswer Acc.StepwiseTopicQuestionGuidanceQwen2.5-7B0.6820.9120.8010.8180.314DeepSeek-V30.7980.8070.7790.6890.510GPT-4o0.7630.9310.8130.7820.485TutorRL-7B0.6820.9530.9680.7890.281EduChat-7B0.4880.8230.8360.6860.218ScaffoldLM-7B0.7850.9880.9990.8300.525最重要的是ScaffoldLM-7B 不是最大的模型但在 6 个 pedagogical metrics 中拿到了 5 个最佳结果。作者认为核心原因就是Stepwise Pedagogical Plan Tutoring Memory分别解决教学结构 实时学生状态适应5. 三篇论文对比论文核心问题核心方法多轮状态教学策略轨迹MathDial缺少高质量 Tutor 数据Human Teacher LLM Student较粗Focus/Probing/Telling有EduDial不知道什么时候问、问什么Bloom 5-stage Student Profile SFTDPO中等10 questioning strategies强ScaffoldLM长对话中教学逻辑漂移Planning Assessment Memory明确建模State-aligned action很强可以画成Education Multi-turn Dialogue │ ┌─────────────────┼──────────────────┐ │ │ │ MathDial EduDial ScaffoldLM │ │ │ ↓ ↓ ↓ Data Construction Pedagogical Explicit Planning Curriculum │ Student Profile State Memory ↓ │ │ Teacher Actions ↓ ↓ Focus / Probe / Tell SFT DPO Assess → Act │ │ │ └─────────────────┴──────────────────┘ ↓ Multi-turn Trajectory5.1 三篇论文背后的技术演进实际上可以总结成第一阶段Response-levelMathDial关注当前这一轮应该怎么回答第二阶段Strategy-levelEduDial关注当前学生状态 教学阶段下应该采用什么教学策略第三阶段Trajectory-levelScaffoldLM其中PPPedagogical PlanMtM_t动态教学 Memory。关注在整条教学轨迹上现在处于哪个 step学生掌握到哪里下一步应该采取什么动作这就是从Response Generation走向State-aware Policy再走向Trajectory-aware Policy5.2 教育多轮对话真正值得研究的 Reward不能简单使用Correctness而应该拆成① Knowledge Gain学生知识状态有没有提升② Pedagogical Quality教师有没有采用合理教学策略③ Adaptability教师是否根据学生状态改变策略④ Independence学生是不是自己解决问题⑤ Leakage Penalty最终这其实比单纯 reward model 更接近“真正优秀教师”的目标。参考资料Macina et al.,MathDial: A Dialogue Tutoring Dataset with Rich Pedagogical Properties Grounded in Math Reasoning Problems, EMNLP Findings 2023.Wei et al.,EduDial: Constructing a Large-scale Multi-turn Teacher-Student Dialogue Corpus, EMNLP Findings 2026.Li et al.,Planning-Guided Tutoring with Assessment-Driven Memory for Pedagogical LLM Tutors, ACL 2026.Chu et al.,LLM Agents for Education: Advances and Applications, EMNLP 2025.Wen et al.,AI for Education (AI4EDU): Advancing Personalized Education with LLM and Adaptive Learning, KDD 2024.Chang et al.,A Survey on Evaluation of Large Language Models, ACM TIST 2024.代码MathDialGitHub - eth-nlped/mathdialEduDialGitHub - ECNU-RAIL/EduDial-EMNLP2026ScaffoldLMGitHub - BNU-ERC-ITEA/ScaffoldLM
返回列表