Skip to main content
QUICK REVIEW

[論文レビュー] Evaluating the Explainers: Black-Box Explainable Machine Learning for Student Success Prediction in MOOCs

Vinitra Swamy, Bahar Radmehr|arXiv (Cornell University)|Jul 1, 2022
Explainable Artificial Intelligence (XAI)被引用数 6
ひとこと要約

この論文は、Bidirectional LSTMsを用いたMOOCにおける学生の成績予測において、LIME、SHAP、DiCE、CEM、およびPermutationSHAPの5つのブラックボックス解釈手法を評価している。解釈手法同士が特徴量の重要度順位で著しく異なることが判明し、解釈の信頼性に影響を与える要因として、モデルやコースの違いよりも解釈手法の選択がより顕著であることが示された。教育分野のAIにおける解釈の信頼性を高めるために、解釈手法の選定が極めて重要であることが強調された。

ABSTRACT

Neural networks are ubiquitous in applied machine learning for education. Their pervasive success in predictive performance comes alongside a severe weakness, the lack of explainability of their decisions, especially relevant in human-centric fields. We implement five state-of-the-art methodologies for explaining black-box machine learning models (LIME, PermutationSHAP, KernelSHAP, DiCE, CEM) and examine the strengths of each approach on the downstream task of student performance prediction for five massive open online courses. Our experiments demonstrate that the families of explainers do not agree with each other on feature importance for the same Bidirectional LSTM models with the same representative set of students. We use Principal Component Analysis, Jensen-Shannon distance, and Spearman's rank-order correlation to quantitatively cross-examine explanations across methods and courses. Furthermore, we validate explainer performance across curriculum-based prerequisite relationships. Our results come to the concerning conclusion that the choice of explainer is an important decision and is in fact paramount to the interpretation of the predictive results, even more so than the course the model is trained on. Source code and models are released at http://github.com/epfl-ml4ed/evaluating-explainers.

研究の動機と目的

  • 教育機械学習分野における解釈手法の比較的評価の不足に対処すること。
  • 複数のMOOCで同じ学生成績予測モデルを用いた場合、異なる解釈手法が特徴量の重要度をどのように順位付けするかを調査すること。
  • 解釈手法が、コースのカリキュラム的必須関係(プリザイム)を、行動特徴量のみを用いて検出できるかを評価すること。
  • 解釈の信頼性に与える影響として、解釈手法の選択がモデルやコースの違いを上回る程度を定量化すること。
  • 教育AI分野におけるより信頼性が高く一貫性のある解釈を得るために、実務家が適切な解釈手法を選定できるように支援すること。

提案手法

  • 5つの最先端のブラックボックス解釈手法(LIME、PermutationSHAP、KernelSHAP、DiCE、CEM)を、5つのMOOCデータセットに訓練された同じBidirectional LSTMモデルに適用した。
  • 一貫性のある比較のため、層別化され均等にサンプリングされた学生の集合に対して、特徴量の重要度スコアを[0,1]に正規化した。
  • 解釈分布の次元と構造を分析するために、主成分分析(PCA)を用いた。
  • 異なる解釈手法間の統計的乖離度を測定するために、Jensen-Shannon距離を計算した。
  • 解釈手法間の特徴量の重要度順位の類似性を評価するために、Spearmanの順位相関係数を用いた。
  • 既知の必須週関係を持つMOOCを対象に、カリキュラムベースの検証を実施し、行動特徴量のみを用いて、解釈手法がこれらの依存関係を検出できるかを検証した。

実験結果

リサーチクエスチョン

  • RQ1同じモデルとコースに対して、異なる解釈手法が生成する解釈はどれほど類似しているか(RQ1)?
  • RQ2異なるMOOC間で、解釈分布はどのように定量的に比較できるか(RQ2)?
  • RQ3解釈は、コースカリキュラムの既知の必須関係と一致するか(RQ3)?
  • RQ4解釈手法の選択が、モデルやコースの選択に比べて、解釈に与える影響はどの程度か(RQ4)?

主な発見

  • 同じモデルとコースに対して、5つの解釈手法は著しく異なる特徴量の重要度分布を生成し、手法間でSpearmanの順位相関係数が低かった。
  • LIMEは一貫してスパースで外れ値的な特徴量セットを生成し、他の手法と比較して最高のJensen-Shannon距離を示し、高い乖離度を示した。
  • 解釈手法の選択が、モデルが学習されたコースの違いよりも、特徴量の重要度分布に大きな影響を与えることが判明し、解釈の信頼性において、解釈手法選定の重要性が強調された。
  • すべての評価対象手法が、週間の間の必須関係を部分的に検出できたが、後半の週(例:第9週)では性能が低下し、長期的依存関係への感受性が低いことが示された。
  • 近接する行動特徴量(最近の行動)は、過去の遠い特徴量よりも一貫して重要度が高いと順位付けされており、特徴量の近接性と認識される重要度の間には強い相関があることが示された。
  • 違いはあったものの、すべての手法がカリキュラム構造とある程度一致しており、行動特徴量が暗黙の必須知識をエンコードしている可能性があるが、完全には反映されていないことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。