Skip to main content
QUICK REVIEW

[论文解读] Mining Frequent Learning Pathways from a Large Educational Dataset

Nirmal Patel, Collin Sellman|arXiv (Cornell University)|May 31, 2017
Business Process Modeling and Analysis参考文献 3被引用 6
一句话总结

本文提出一种两阶段方法,通过首先基于序列相似性使用基于编辑距离的算法对学习者聚类,然后应用基于图的过程挖掘方法,从大规模教育数据集中提取频繁学习路径。关键贡献在于通过迭代过滤从交互事件日志派生的有向图,识别出学生学习的‘高速公路’——即重复出现、高流量的活动序列,从而实现复杂数字学习环境中集体学习行为的可解释性可视化。

ABSTRACT

In this paper, we describe data mining techniques used to extract frequent learning pathways from a large educational dataset. These pathways were extracted as a directed graph that encoded student learning processes. Our dataset contains more than 800 million interactions of over 3 million anonymized students in an online learning platform. Performing process mining on large and complex datasets regularly yields incomprehensible process models. Although, if we cluster data and obtain groups following similar processes, we can greatly improve process mining results. To this end, we developed a sequence clustering algorithm that let us group students who followed similar learning pathways. To extract frequent learning pathways from these clusters of data, we developed a graph-based process discovery algorithm that revealed to us the sequences of learning activities that many students followed. These sequences represented highways of student learning.

研究动机与目标

  • 解决大规模学生交互数据过程挖掘中的可视化与分析不可理解问题。
  • 从在线学习平台中数百万名学生交互中识别出连贯且高频的学习路径。
  • 通过在基于图的分析前对相似学生学习序列进行聚类,降低复杂度,从而改进过程挖掘结果。
  • 使教育工作者和设计者能够理解学生的常见学习路径,并与预期的课程路径进行比较。
  • 开发一种可扩展的、开源的方法,用于挖掘和可视化数字教育环境中的频繁学习路径。

提出的方法

  • 应用基于编辑距离的序列聚类算法,将具有相似学习活动序列的学生分组,以降低模型复杂度。
  • 从序列活动转换构建有向邻接矩阵,其中单元格 (i,j) 记录学生从活动 i 转移到 j 的次数。
  • 从邻接矩阵构建加权有向图,节点代表活动,边权重表示转移频率。
  • 从图中过滤掉低频边,以消除噪声并揭示主导性、高流量的学习路径。
  • 通过节点大小与度数成比例、边权重突出显示频繁 traversed 的路径,对修剪后的图进行可视化。
  • 聚焦于学习路径最长的聚类(聚类 3)以发现密集且重复出现的学习高速公路。

实验结果

研究问题

  • RQ1在大规模教育数据集中,学生最常 traversed 的学习活动序列是什么?
  • RQ2如何降低从数百万名学生交互中衍生出的过程模型的复杂度,以使其可解释?
  • RQ3序列聚类是否能有效在过程挖掘前将具有相似学习路径的学生分组?
  • RQ4图可视化与边过滤在揭示主导性学习路径中起到什么作用?
  • RQ5所发现的学习路径与预期的课程结构相比如何?

主要发现

  • 基于学习路径长度,识别出三个学生聚类:短路径(平均 2.80 个活动)、中等路径(13.72 个)和长路径(44.85 个)。
  • 聚类 3(路径最长)包含 3,952 名学生,生成的图包含 474 个节点和 6,662 条边,表明路径复杂度较高。
  • 在过滤低频边后,图中显现出清晰的“高速公路”——即频繁 traversed 的活动序列,使主导性学习模式在视觉上可解释。
  • 过滤后图的可视化使研究人员能够识别出三个按顺序频繁 traversed 的核心活动,这些活动也与预期的课程结构一致。
  • 基于图的过程挖掘方法成功地将一个‘意大利面式’模型转化为清晰、可解释的集体学生行为表示。
  • 序列聚类技术的开源 R 实现已公开发布,支持可复现性与更广泛的应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。