为什么需要模拟教师?
习题学习路径推荐旨在根据学生的历史学习记录,为其推荐下一道习题,帮助学生更好地掌握目标知识,是智能教育领域内的重要研究任务。
任务定义:

早期方法主要从历史交互数据中学习推荐规律:基于邻域的方法(如 KNN[3])通过匹配相似学习轨迹推荐相近的学习路径;序列建模方法(如 GRU4Rec[4])将学生学习过程视为行为序列,利用深度学习模型捕捉序列依赖关系。近年来,研究者进一步将学习路径推荐建模为动态决策问题,并采用强化学习方法优化推荐策略[5][6],具体来说,将学生当前学习状态视为状态(state),将推荐习题视为动作(action),根据学习效果设计奖励函数(reward),通过强化学习算法调整推荐策略,得到更优的推荐结果。然而,现有方法仍存在三个核心缺陷:
信息粒度较粗(Coarse-grained Information): 主要依赖学生—题目交互序列,将习题表示为离散 ID,忽略了题目文本中蕴含的细粒度语义信息。
泛化能力有限(Limited Generalization Ability): 通常依赖特定数据集训练,在新的学习场景下迁移能力不足。
性能不稳定(Performance Instability): 强化学习方法依赖大量交互数据训练,而真实教育场景中的学习记录较为稀疏,可能影响模型的推荐效果。
相比之下,真实教师的三项关键能力为个性化学习路径推荐提供了启发:
教学知识:教师拥有相对完整的知识体系,能够理解题目语义和知识关联。
反思能力:教师会根据学生反馈不断反思并优化策略。
历史经验:教师会参考相似学生的历史经验。
能否构建模拟真实教师决策的 Agent,使学习路径推荐不仅关注学生历史行为,也能够结合知识、反馈和经验,做出更合理的推荐?
近年来,LLM 的语言理解和推理能力为构建这样的 Teacher Agent 提供了可能。
AAAI 2025 的 GenAL[1] 与 EMNLP 2025 的 ReAL[2] 正是在这一方向上的代表性工作——前者首次让 LLM Agent 模拟教师的教学推理过程,后者则在此基础上进一步引入经验迁移机制。
GenAL: Generative Agent for Adaptive Learning[1]

GenAL 是 LLM Agent 应用于个性化学习路径推荐的开创性工作。其核心思路在于,将习题学习路径推荐从序列预测问题重新理解为教学决策问题,即让 LLM 模拟教师分析学生状态并推荐习题的推理过程。
基于此,GenAL 设计了双 Agent 协作框架:
全局思考智能体(Global Thinking Agent, GTA):从全局视角把握学生状态和推荐策略。
日志记忆模块(Log Memory):存储学生历史学习记录,为后续分析提供信息基础; 教育工具模块(Edu Tools):引入知识追踪模型,估计学生当前知识掌握状态,为框架的推荐决策提供量化依据; 反思器(Reflector):结合答题反馈与知识状态信息,生成学生学习画像,反思推荐策略,指导 LTA 完成推荐任务。 局部教学智能体(Local Teaching Agent, LTA):负责具体的习题筛选与推荐。
教学工具模块(Teaching Tools):引入知识点图谱作为教育先验信息,从相关知识点中筛选出候选习题集合; 推荐器(Recommender):根据 GTA 反思后的推荐策略,从候选习题中选出最终推荐项,并向 GTA 反馈推荐理由及预测答案。

在三个教育数据集上的实验结果表明,GenAL 相比传统方法取得了更优表现。其优势主要来源于两个方面:一方面,LLM 能够理解文本中蕴含的细粒度语义信息,突破传统方法仅依赖学生—题目交互序列的限制;另一方面,GenAL 通过 GTA 与 LTA 的协作模拟教师的学生分析和教学决策,使推荐结果更加符合个性化教学逻辑。

ReAL: How Can LLMs Simulate the Real Teacher? Retrieval-enhanced Agent for Adaptive Learning[2]

GenAL 验证了 LLM Agent 模拟教师完成学生分析与习题推荐的可行性,但真实教师的能力不仅限于知识与推理,还包括长期积累的经验。
针对这一问题,ReAL 在框架中进一步引入了 检索增强(Retrieval-enhanced) 机制,使 Agent 能够主动检索历史相似案例,并将相似学生的经验融入推荐过程。
ReAL 的框架主要由三部分组成:
内部知识理解:在规划器(Planner)模块,利用 LLM 解析习题语义、更新学生画像。
记忆模块(Memory):存储并管理历史学习记录与学生画像; 教育工具模块(Edu Tools):引入知识追踪模型与知识点图谱,帮助 LLM 更准确地理解学生当前知识状态,并筛选得到候选习题集合。 外部经验借鉴:在行动器(Actor)模块,检索与当前学生具有相似知识状态的历史学习者,将其学习轨迹和反馈作为经验信息辅助推荐决策。
动态策略调整:在反思器(Reflector)模块,学生完成推荐习题后的作答反馈被用于与记忆模块(Memory)交互,更新推荐策略。

实验结果表明,引入相似学习者检索机制能够进一步提升推荐效果。尤其在交互数据较为稀疏(TextLog 数据集)的场景下,借助已有案例提供的经验信息能够有效增强推荐稳定性。

从 Teacher Simulation 到 Experienced Teacher Simulation
GenAL 与 ReAL 共同探索了一个核心问题:如何让 LLM Agent 更接近真实教师?
二者是一种能力上的递进:
GenAL 关注教师推理(Teacher Reasoning): 模拟一个具有教育知识和推理能力的教师,让 Agent 理解学生状态,完成教学规划。 ReAL 在此基础上关注教师经验(Teacher Experience): 模拟一个能够借鉴历史经验的教师,让 Agent 检索相似学生,将历史经验迁移至当前推荐决策中。
二者共同推动学习路径推荐从预测下一道题走向模拟教师如何决定下一道题。
这一转变,或可视为习题学习路径推荐从数据拟合向认知建模的一次拓展。
参考文献
[1] Lv R, Liu Q, Gao W, et al. Genal: Generative agent for adaptive learning[C]//Proceedings of the AAAI Conference on Artificial Intelligence. 2025, 39(1): 577-585.
[2] Lv R, Liu Q, Gao W, et al. ReAL: How Can LLMs Simulate the Real Teacher? Retrieval-enhanced Agent for Adaptive Learning[J]. Thinking, 2025, 1: 2.
[3] Cover T, Hart P. Nearest neighbor pattern classification[J]. IEEE transactions on information theory, 1967, 13(1): 21-27.
[4] Hidasi B, Karatzoglou A, Baltrunas L, et al. Session-based recommendations with recurrent neural networks[J]. arXiv preprint arXiv:1511.06939, 2015.
[5] Liu Q, Tong S, Liu C, et al. Exploiting cognitive structure for adaptive learning[C]//Proceedings of the 25th ACM SIGKDD international conference on knowledge discovery & data mining. 2019: 627-635.
[6] Li Q, Xia W, Yin L, et al. Graph enhanced hierarchical reinforcement learning for goal-oriented learning path recommendation[C]//Proceedings of the 32nd ACM International Conference on Information and Knowledge Management. 2023: 1318-1327.

欢迎关注北京大学王选计算机研究所数据管理实验室微信公众号“图谱学苑“
实验室官网:https://mod.wict.pku.edu.cn/
微信社区群:请回复“社区”获取
gStore官网:https://www.gstore.cn/
GitHub:https://github.com/pkumod/gStore
Gitee:https://gitee.com/PKUMOD/gStore






