Skip to main content
QUICK REVIEW

[論文レビュー] Mining Frequent Learning Pathways from a Large Educational Dataset

Nirmal Patel, Collin Sellman|arXiv (Cornell University)|May 31, 2017
Business Process Modeling and Analysis参考文献 3被引用数 6
ひとこと要約

本論文は、大規模な教育データセットから頻出する学習経路を抽出する二段階的手順を提案する。まず、編集距離に基づくアルゴリズムを用いて、学習行動のシーケンス類似度に基づいて学生をクラスタリングし、次にグラフベースのプロセス発見手法を適用して、代表的で頻度の高い学習ルートを明らかにする。主な貢献は、相互作用ログから導出された有向グラフを繰り返しフィルタリングすることで、繰り返し発生する高流量の学習行動のシーケンス(「ハイウェイ」)を同定し、複雑なデジタル学習環境における集団的学習行動の解釈可能な可視化を可能にすることにある。

ABSTRACT

In this paper, we describe data mining techniques used to extract frequent learning pathways from a large educational dataset. These pathways were extracted as a directed graph that encoded student learning processes. Our dataset contains more than 800 million interactions of over 3 million anonymized students in an online learning platform. Performing process mining on large and complex datasets regularly yields incomprehensible process models. Although, if we cluster data and obtain groups following similar processes, we can greatly improve process mining results. To this end, we developed a sequence clustering algorithm that let us group students who followed similar learning pathways. To extract frequent learning pathways from these clusters of data, we developed a graph-based process discovery algorithm that revealed to us the sequences of learning activities that many students followed. These sequences represented highways of student learning.

研究の動機と目的

  • 大規模な学生相互作用データのプロセスマイニングにおける視覚的・分析的不可解性の課題に対処すること。
  • オンライン学習プラットフォームにおける数百万件の学生相互作用から、一貫性があり頻度の高い学習経路を同定すること。
  • グラフベースの分析の前段階として、類似した学生学習シーケンスをクラスタリングすることで、プロセスマイニングの結果の複雑さを低減すること。
  • 教育者や設計者が共通の学生の学習経路を理解し、それらを意図されたカリキュラム経路と比較できるようにすること。
  • デジタル教育環境における頻出学習経路のマイニングと可視化のためのスケーラブルでオープンソースの手法を開発すること。

提案手法

  • 編集距離に基づくシーケンスクラスタリングアルゴリズムを適用し、類似した学習行動シーケンスを持つ学生をグループ化することで、モデルの複雑さを低減した。
  • 順次的なアクティビティ遷移から有向隣接行列を構築し、セル(i,j)には学生がアクティビティ i から j に移動した回数を記録した。
  • 隣接行列から重み付き有向グラフを構築し、ノードはアクティビティを表し、エッジの重みは遷移頻度を示した。
  • 低頻度エッジをフィルタリングしてノイズを除去し、代表的で高流量の学習経路を明らかにした。
  • ノードのサイズを次数に比例させ、エッジの重みを強調することで、頻繁に通過されるルートを強調した可視化を実施した。
  • 最も長い学習経路を持つクラスタ(クラスタ3)に焦点を当て、密で繰り返し発生する学習ハイウェイを同定した。

実験結果

リサーチクエスチョン

  • RQ1大規模な教育データセットにおける学生の間で最も頻繁に通過される学習アクティビティのシーケンスは何か?
  • RQ2数百万件の学生相互作用から導出されたプロセスモデルの複雑さを低減し、解釈可能にするにはどうすればよいか?
  • RQ3シーケンスクラスタリングは、プロセスマイニングの前段階で、類似した学習経路を持つ学生を効果的にグループ化できるか?
  • RQ4グラフ可視化とエッジフィルタリングは、代表的学習経路を明らかにする上で果たす役割は何か?
  • RQ5同定された学習経路は、意図されたカリキュラム構造とどのように比較できるか?

主な発見

  • 学習経路の長さに基づき、3つの明確な学生クラスタが同定された:短い(平均2.80アクティビティ)、中程度(13.72)、長い(44.85)。
  • 最も長い経路を持つクラスタ3には3,952人の学生が含まれており、474ノードと6,662エッジを持つグラフを生成し、高い経路の複雑さを示した。
  • 低頻度エッジをフィルタリングした後、明確な「ハイウェイ」(頻繁に通過されるアクティビティのシーケンス)が明らかになり、代表的な学習パターンが視覚的に解釈可能になった。
  • フィルタリングされたグラフの可視化により、3つのコアアクティビティが連続して頻繁に通過されていることが特定され、これは意図されたカリキュラム構造とも一致した。
  • グラフベースのプロセス発見手法により、「スパゲッティ」モデルが、集団的学習行動を明確に解釈可能な表現に変換できた。
  • シーケンスクラスタリング手法のオープンソースR実装が公開されており、再現性の確保と広範な応用を支援している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。