Skip to main content
QUICK REVIEW

[論文レビュー] Early Prediction of Course Grades: Models and Feature Selection

Hengxuan Li, Collin Lynch|arXiv (Cornell University)|Dec 3, 2018
Online Learning and Analytics参考文献 10被引用数 13
ひとこと要約

本研究では、混合型授業の最初の6週間にわたり収集された学生行動データを用いて、機械学習モデルを訓練することで、授業成績の早期予測を提案する。オンライン宿題ログと行動から抽出された特徴量を用い、SVM、SVR、決定木、ナイーブベイズ、K-NNの5つのアルゴリズムを評価した結果、SVMが他のモデルを上回り、ベースライン予測を顕著に改善した。

ABSTRACT

In this paper, we compare predictive models for students' final performance in a blended course using a set of generic features collected from the first six weeks of class. These features were extracted from students' online homework submission logs as well as other online actions. We compare the effectiveness of 5 different ML algorithms (SVMs, Support Vector Regression, Decision Tree, Naive Bayes and K-Nearest Neighbor). We found that SVMs outperform other models and improve when compared to the baseline. This study demonstrates feasible implementations for predictive models that rely on common data from blended courses that can be used to monitor students' progress and to tailor instruction.

研究の動機と目的

  • 初期段階のデータを用いて学生の最終成績を予測するモデルを開発・評価すること。
  • 限られたデータで学生の成績を予測する際に、どの機械学習アルゴリズムが最も優れた性能を示すかを特定すること。
  • 混合学習環境におけるオンライン学生相互作用からの特徴選択の影響を評価すること。
  • 早期介入のための実用的でデータ駆動型のアプローチを提供すること。

提案手法

  • 混合型授業の最初の6週間にわたり、オンライン宿題提出ログやその他のデジタル相互作用から学生行動特徴を収集した。
  • 提出頻度、所要時間、正答率、相互作用パターンを含む18個の一般的な特徴量を抽出した。
  • SVM、サポートベクターレグレッション(SVR)、決定木、ナイーブベイズ、K-近傍法の5つの機械学習モデルを訓練した。
  • ホールドアウトテストセットを用いて、RMSE や決定係数(R-squared)などの標準的な回帰指標でモデルの性能を評価した。
  • モデル学習のための最も予測に役立つ特徴量のサブセットを特定するために、特徴選択技術を適用した。
  • 実世界のデータセット(大学の混合型授業から得たもの)を用いることで、実用的妥当性と一般化可能性を確保した。

実験結果

リサーチクエスチョン

  • RQ1どの機械学習モデルが最終成績の最も正確な早期予測を達成するか?
  • RQ2初期の授業行動特徴の異なる組み合わせが予測性能にどのように影響するか?
  • RQ3特徴選択が早期成績予測におけるモデル精度をどの程度向上させるか?
  • RQ4オンライン学習プラットフォームから容易に収集可能な一般的な特徴量に基づいて訓練されたモデルは、単純なベースラインを上回るか?
  • RQ5このようなモデルを実際の混合学習環境に導入する上で、実用的か?

主な発見

  • SVM(サポートベクターマシン)は、テストされたすべてのモデルの中で予測精度が最も高く、SVR、決定木、ナイーブベイズ、K-NNを上回った。
  • SVMモデルはベースラインモデルと比較して顕著に予測性能が向上し、早期介入における機械学習の価値を示した。
  • 特徴選択により、初期の授業活動から最も情報量の多い行動パターンに焦点を当てたモデル性能の向上が達成された。
  • 本研究では、初期の行動データ(特にオンライン宿題システムからのもの)が、最終的な授業成績を信頼性高く予測できることを確認した。
  • 軽量でスケーラブルなモデルのリアルタイム教育モニタリングシステムへの導入を支援する結果となった。
  • 本アプローチは、一般的なデータソースを用いた標準的な混合学習プラットフォームでも実装可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。