Skip to main content
QUICK REVIEW

[论文解读] Sequence Modelling For Analysing Student Interaction with Educational Systems

Christian Hansen, Casper Worm Hansen|arXiv (Cornell University)|Aug 14, 2017
Online Learning and Analytics被引用 9
一句话总结

本文提出将教育系统中的学生互动建模为多个马尔可夫链的概率分布,其中每个链代表一种独特的使用模式。基于来自Edulab的108万次会话,采用改进的k-means聚类算法,该方法识别出六种潜在的行为模式,其中12.5万次会话表现出低效行为——为用户画像构建与系统优化提供了比单一链模型更细致的替代方案。

ABSTRACT

The analysis of log data generated by online educational systems is an important task for improving the systems, and furthering our knowledge of how students learn. This paper uses previously unseen log data from Edulab, the largest provider of digital learning for mathematics in Denmark, to analyse the sessions of its users, where 1.08 million student sessions are extracted from a subset of their data. We propose to model students as a distribution of different underlying student behaviours, where the sequence of actions from each session belongs to an underlying student behaviour. We model student behaviour as Markov chains, such that a student is modelled as a distribution of Markov chains, which are estimated using a modified k-means clustering algorithm. The resulting Markov chains are readily interpretable, and in a qualitative analysis around 125,000 student sessions are identified as exhibiting unproductive student behaviour. Based on our results this student representation is promising, especially for educational systems offering many different learning usages, and offers an alternative to common approaches like modelling student behaviour as a single Markov chain often done in the literature.

研究动机与目标

  • 解决单一马尔可夫链模型在捕捉复杂教育系统中多样化学生互动模式方面的局限性。
  • 开发一种可扩展且可解释的方法,将学生行为建模为多个潜在使用模式的概率分布。
  • 通过学习到的马尔可夫链的定性分析,检测低效或次优的学生行为。
  • 通过识别大规模日志数据中的不同行为聚类,实现更有效的系统改进。

提出的方法

  • 将学生会话建模为一系列操作(例如,观看课程、回答问题),每个操作属于一种潜在的行为模式。
  • 将每位学生表示为多个一阶马尔可夫链的概率分布,其中每个链捕捉一种独特的行为模式。
  • 使用改进的k-means聚类算法估计聚类中心(即马尔可夫链),避免在大规模数据集上使用EM算法时收敛缓慢的问题。
  • 通过状态之间的转移概率(例如,Qw_c 表示在某道题上答错)定义聚类中心,初始中心通过领域知识指导或随机初始化进行优化。
  • 在Edulab(一个大规模丹麦数学学习平台)的真实日志数据上应用聚类,数据包含12至14岁学生共108万次会话。
  • 对生成的马尔可夫链进行定性分析,以解释行为模式并检测低效使用行为,如重复答错或课程后缺乏练习。

实验结果

研究问题

  • RQ1在不同会话中,学生在多大程度上可被建模为多个潜在使用行为的概率分布?
  • RQ2与单一链模型相比,将学生行为建模为马尔可夫链的混合是否能提升可解释性并更有效地检测低效行为?
  • RQ3所提出的聚类方法能否有效识别大规模教育日志数据中的不同行为模式?
  • RQ4通过对学习到的马尔可夫链进行定性解读,能获得哪些关于系统设计与学生学习的洞见?

主要发现

  • 该方法成功识别出六条独特的马尔可夫链,分别代表不同的学生使用模式,其中12.5万次会话被归类为表现出低效行为。
  • 链2被识别为次优模式,其特征为重复答错和缺乏课后练习,提示需要干预措施,如强制安排后续问题。
  • 平均而言,每位学生在六种会话类型中参与约3.5种,表明学生个体间存在显著的行为差异,支持采用多链建模的必要性。
  • 各链的平均序列长度在26.79至44.85个操作之间,表明没有单一链仅捕捉短会话或长会话,而是反映多样化的使用模式。
  • 改进的k-means方法在合成数据中有效恢复了底层生成的马尔可夫链,验证了该方法检测真实行为模式的能力。
  • 将学生表示为马尔可夫链的概率分布向量,使得标准机器学习技术可用于检测行为漂移并实现学习路径的个性化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。