Skip to main content
QUICK REVIEW

[论文解读] Bridging Declarative, Procedural, and Conditional Metacognitive Knowledge Gap Using Deep Reinforcement Learning

Mark Abdelshiheed, John Wesley Hostetter|arXiv (Cornell University)|Apr 23, 2023
Intelligent Tutoring Systems and Adaptive Learning被引用 5
一句话总结

本文提出一种深度强化学习(DRL)策略,用于在智能辅导系统(ITS)中提供自适应元认知干预,以弥合学生在陈述性、程序性和条件性知识之间的差距。该DRL策略通过提升学生在后续概率辅导系统中的表现(该系统未提供任何干预)成功为未来学习做好准备,表明DRL能够适应元认知发展的动态变化,并增强学生的策略自主性。

ABSTRACT

In deductive domains, three metacognitive knowledge types in ascending order are declarative, procedural, and conditional learning. This work leverages Deep Reinforcement Learning (DRL) in providing adaptive metacognitive interventions to bridge the gap between the three knowledge types and prepare students for future learning across Intelligent Tutoring Systems (ITSs). Students received these interventions that taught how and when to use a backward-chaining (BC) strategy on a logic tutor that supports a default forward-chaining strategy. Six weeks later, we trained students on a probability tutor that only supports BC without interventions. Our results show that on both ITSs, DRL bridged the metacognitive knowledge gap between students and significantly improved their learning performance over their control peers. Furthermore, the DRL policy adapted to the metacognitive development on the logic tutor across declarative, procedural, and conditional students, causing their strategic decisions to be more autonomous.

研究动机与目标

  • 解决在演绎领域中通过靶向元认知知识差距来为学生未来学习做好准备的长期挑战。
  • 探究深度强化学习(DRL)是否能够提供自适应干预,以弥合陈述性、程序性和条件性知识之间的差距。
  • 评估在逻辑辅导系统中实施DRL干预后,学生在后续概率辅导系统中的表现是否得到提升(该系统未提供进一步干预)。
  • 考察DRL策略如何适应学生在不同类型知识上的元认知发展中的动态变化。
  • 评估与对照条件相比,DRL引导的干预在多大程度上提升了学生策略决策的自主性。

提出的方法

  • 根据学生在逻辑辅导系统中的表现和策略使用情况,将学生分类为陈述性、程序性或条件性元认知知识类型。
  • 设计DRL策略,基于学生对干预的配合度和策略使用情况,提供自适应干预(提示、展示后向链BC,或无干预)。
  • 使用关联规则挖掘分析学生决策序列,以解释DRL策略行为,规则形式为{action_t, compliance_t} ⇒ action_{t+1}。
  • 计算18种可能规则的支持度与置信度,以识别在不同学生类型中频繁出现且高可靠的策略模式。
  • 在46名实验学生的598个训练决策上训练DRL策略,每位学生平均13个决策。
  • 评估DRL策略在逻辑辅导系统和概率辅导系统中的学习表现与策略自主性影响。
(a) Forward Chaining (FC)
(a) Forward Chaining (FC)

实验结果

研究问题

  • RQ1DRL驱动的干预是否能有效弥合智能辅导系统中陈述性、程序性和条件性知识类型之间的元认知知识差距?
  • RQ2在逻辑辅导系统中实施DRL干预后,是否能提升学生在后续概率辅导系统中的表现(该系统未提供任何干预)?
  • RQ3DRL策略如何根据学生在不同类型知识上的元认知发展变化调整其干预策略?
  • RQ4与对照条件相比,DRL引导的干预在多大程度上提升了学生的策略决策自主性?
  • RQ5学生行为与配合度中的哪些模式揭示了DRL策略对元认知状态演变的适应能力?

主要发现

  • DRL干预显著提升了学生在逻辑辅导系统和后续概率辅导系统中的学习表现,后者未提供任何干预。
  • 初始仅具备陈述性或程序性知识的学生在概率辅导系统中的表现优于其条件性知识同龄人,表明DRL成功弥合了元认知知识差距。
  • DRL策略根据学生配合度调整干预,最高频规则显示其会避免对已正确使用BC的学生实施干预(例如,{无, 反对} ⇒ 无,支持度23%)。
  • 策略通过动态调整实现响应:当学生反对干预时,会切换为其他干预方式(如,{提示, 反对} ⇒ 展示BC,支持度7%,置信度69%),表明其对元认知状态变化的敏感性。
  • 接受DRL干预的学生表现出更高的策略自主性,因为策略随时间减少了对直接干预的依赖。
  • 关联规则挖掘表明,DRL策略将那些知道如何且何时使用后向链的学生识别为条件性学习者,从而避免不必要的干预。
(b) Backward Chaining (BC)
(b) Backward Chaining (BC)

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。