[论文解读] Mining MOOC Clickstreams: On the Relationship Between Learner Behavior and Performance
本文提出了两种框架来建模MOOC视频观看点击流——基于事件序列和基于位置访问——以将学习者行为与表现联系起来。研究识别出重复出现的行为模式,并表明基于位置的模型显著提高了首次作答正确(CFA)的预测准确率和F1值,尤其在数据量较少的情况下表现更优。
We study student behavior and performance in two Massive Open Online Courses (MOOCs). In doing so, we present two frameworks by which video-watching clickstreams can be represented: one based on the sequence of events created, and another on the sequence of positions visited. With the event-based framework, we extract recurring subsequences of student behavior, which contain fundamental characteris- tics such as reflecting (i.e., repeatedly playing and pausing) and revising (i.e., plays and skip backs). We find that some of these behaviors are significantly associated with whether a user will be Correct on First Attempt (CFA) or not in answering quiz questions. With the position-based framework, we then devise models for performance. In evaluating these through CFA prediction, we find that three of them can substantially improve prediction quality in terms of accuracy and F1, which underlines the ability to relate behavior to performance. Since our prediction considers videos individually, these benefits also suggest that our models are useful in situations where there is limited training data, e.g., for early detection or in short courses.
研究动机与目标
- 理解学生在MOOC中观看视频的行为与测验表现之间的关系,特别是与测验正确性之间的关联。
- 利用模式发现算法从点击流数据中识别重复出现的行为模式(例如,复习、反思)。
- 开发基于行为的性能预测模型,使其在训练数据有限的情况下优于基线模型。
- 评估基于位置的点击流表示方法是否比仅基于事件的模型更能预测CFA结果。
- 通过将行为信号与知识获取关联,实现在早期识别处于风险中的学习者。
提出的方法
- 作者采用两种框架表示点击流数据:一种基于离散事件序列(如播放、暂停、快进)并进行时长量化,另一种基于访问的视频位置序列。
- 应用模式识别算法提取事件的重复子序列,并将其视为如反思或复习等行为模式。
- 在性能预测方面,构建基于位置的模型,将用户行为编码为在不同视频位置之间的转移以及事件之间的时间间隔。
- 使用准确率和F1分数评估预测性能,并与仅使用测验历史的基线模型进行比较。
- 模型在单个视频上进行训练和测试,使其适用于短课程或数据稀疏的早期检测场景。
- 使用统计检验验证所识别模式与CFA结果之间关联的显著性。
实验结果
研究问题
- RQ1在视频观看点击流中,哪些重复出现的行为模式与测验的首次作答正确(CFA)表现显著相关?
- RQ2基于位置的点击流表示方法与基于事件的表示方法在预测CFA结果方面有何差异?
- RQ3基于行为的模型是否能在仅依赖评估历史的基线模型基础上,进一步提升CFA预测准确率和F1值?
- RQ4是否存在特定的行为模式(如反思或复习),可作为有效学习或知识掌握的强信号?
- RQ5这些模型在低数据设置下(如短课程或新MOOC中的早期检测)的泛化能力如何?
主要发现
- 多种重复出现的行为模式(如反思——反复播放和暂停,以及复习——播放后倒退跳转)与CFA或非CFA结果显著相关,即使在看似反直觉的情况下亦然。
- 三种基于位置的模型在CFA预测准确率和F1分数上均优于基线模型,表明行为模式是性能的强有力预测因子。
- 预测性能的提升严格高于先前研究的报告结果(例如,相比基线提升3%),即使仅聚焦于单个视频也是如此。
- 模型在低数据设置下的有效性表明其在早期识别学习困难者或个性化内容推送方面具有巨大潜力。
- 本研究证实,视频观看行为,特别是位置转移和事件持续时间,蕴含着有意义的知识获取信号。
- 基于位置的框架优于仅基于事件的模型,因其能捕捉更细微的学习动态,例如用户在特定视频片段停留的时间长短。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。