Skip to main content
QUICK REVIEW

[論文レビュー] PEEK: A Large Dataset of Learner Engagement with Educational Videos

Sahan Bulathwela, María Pérez‐Ortiz|arXiv (Cornell University)|Sep 3, 2021
Online Learning and Analytics参考文献 54被引用数 4
ひとこと要約

PEEK は、教育動画断片における学習者の関与を、説明可能なパーソナライズ化に結びつける、大規模かつ公開可能なデータセットである。視聴時間のインタラクションをウィキペディアベースの知識トピックに関連付けることで、関与予測モデルのベンチマークが可能となり、実験では TrueLearn Novel などの時系列に配慮したモデルが最先端の性能を示した。これは次世代の教育レコメンデーションシステムにおける価値を示している。

ABSTRACT

Educational recommenders have received much less attention in comparison to e-commerce and entertainment-related recommenders, even though efficient intelligent tutors have great potential to improve learning gains. One of the main challenges in advancing this research direction is the scarcity of large, publicly available datasets. In this work, we release a large, novel dataset of learners engaging with educational videos in-the-wild. The dataset, named Personalised Educational Engagement with Knowledge Topics PEEK, is the first publicly available dataset of this nature. The video lectures have been associated with Wikipedia concepts related to the material of the lecture, thus providing a humanly intuitive taxonomy. We believe that granular learner engagement signals in unison with rich content representations will pave the way to building powerful personalization algorithms that will revolutionise educational and informational recommendation systems. Towards this goal, we 1) construct a novel dataset from a popular video lecture repository, 2) identify a set of benchmark algorithms to model engagement, and 3) run extensive experimentation on the PEEK dataset to demonstrate its value. Our experiments with the dataset show promise in building powerful informational recommender systems. The dataset and the support code is available publicly.

研究の動機と目的

  • パーソナライズド教育レコメンデーションの分野における大規模で公開可能なデータセットの不足に対処するため、新規でスケーラブルなデータセットを構築すること。
  • 人間が直感的に理解できる知識コンポonentsにリンクされた、詳細で時間分解能の高い関与信号を提供することで、パーソナライズドラーニングシステムの研究を可能にすること。
  • 非公式なオンライン学習環境における学習者の関与を予測する、データ効率的で解釈可能かつ時系列に配慮したモデルの開発を促進すること。
  • 教育動画データとウィキペディアの豊富な知識構造を統合することで、説明可能で意味論的に根拠付けられた学習者モデリングを支援すること。
  • ベースラインアルゴリズムを含む形式的なベンチマークフレームワークを確立し、動画断片に対する学習者関与の予測性能を評価すること。

提案手法

  • 10,200以上の教育動画レクチャーを含む、オープン教育リポジトリから抽出したデータから PEEK データセットを構築する。
  • 各動画を断片に分割し、音声を文字起こし、キーワードをエンティティリンクによってウィキペディアのページに関連付けることで意味的根拠を付与する。
  • 各動画断片を原子的なウィキペディアの概念としての知識コンポーネント(KC)で表現することで、人間が直感的に理解できるコンテンツ表現を可能にする。
  • 個々のユーザーの視聴時間を正規化し、二値ラベル(関与あり vs. 関与なし)に離散化することで、教師ありの関与予測タスクを定義する。
  • 知識トレーシング、IRT、TrueLearn などの深層学習モデルを含む、さまざまなベースラインモデルを適用し、断片化された動画データにおける関与を予測する。
  • ウィキペディアの階層的構造(カテゴリツリー、ハイパーリンク、意味的類似性)を活用してコンテンツ表現を豊かにし、知識グラフに基づくモデリングを支援する。

実験結果

リサーチクエスチョン

  • RQ1教育動画断片における学習者の関与に関する大規模で公開可能なデータセットは、パーソナライズド教育レコメンデーションシステムの開発を改善できるか?
  • RQ2ウィキペディアから導出された人間が直感的に理解できる知識コンポーネントを用いる場合、さまざまなベースラインモデルの関与予測効果はどの程度か?
  • RQ3時系列に配慮したモデルは、静的または類似性ベースのモデルに比べて、動的な学習者関与パターンをどの程度うまく捉えられるか?
  • RQ4ウィキペディアの知識構造(例:カテゴリツリー、意味的類似性)の統合は、関与予測モデルの性能と解釈可能性を向上させられるか?
  • RQ5本データセットにおける知識コンポーネントの共起パターンから、学習者行動、知識パスウェイ、必須関係構造に関する何らかの知見が得られるか?

主な発見

  • PEEK データセットには、20,000人以上の学習者が10,200以上の教育動画断片と関与しており、それぞれがウィキペディアベースの知識コンポーネントに関連しており、公開済みの教育的関与データセットの中で最大クラスに位置する。
  • TrueLearn Novel モデルが優れた性能を示し、学習者状態の時系列的モデリングが、静的または類似性ベースのベースラインに比べて予測精度を顕著に向上させることを示している。
  • 本データセットは、関心の減衰や学習者好みの変化といった時系列的ダイナミクスのモデリングを可能としており、順序付きモデルの優れた性能がそれを裏付けている。
  • ウィキペディアに根拠を置く人間が直感的に理解できる知識コンポーネントにより、自己認識や自己制御を支援する解釈可能な学習者モデルの構築が可能になる。
  • ウィキペディアの知識構造(例:カテゴリツリー、意味的類似性)の統合により、コンテンツ表現が豊かになり、必須関係のモデリングや知識グラフに基づくレコメンデーションへの道が開かれる。
  • 本データセットは関与予測を超える多様な研究課題を可能にし、知識構造の同定、学習者クラスタリング、断片レベルの集約によるパーソナライズド動画レコメンデーションが可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。