Skip to main content
QUICK REVIEW

[論文レビュー] Neural network approach to classifying alarming student responses to online assessment

Christopher M. Ormerod, Amy E. Harris|arXiv (Cornell University)|Sep 20, 2018
Online Learning and Analytics参考文献 37被引用数 4
ひとこと要約

本論文では、自己傷害、暴力、虐待などの危険な学生の反応を、通常の反応から分類することで、オンライン評価における警戒を必要とする反応を検出するため、注意メカニズムを備えた双方向スタックLSTMおよびGRUネットワークを用いた深層学習手法を提案する。最も優れた性能を示したモデル、すなわち注意メカニズムを備えた双方向スタックLSTMは、10%のレビュー閾値で98.7%の警戒検出率を達成し、高リスクケースにおける早期対応を顕著に向上させた。

ABSTRACT

Automated scoring engines are increasingly being used to score the free-form text responses that students give to questions. Such engines are not designed to appropriately deal with responses that a human reader would find alarming such as those that indicate an intention to self-harm or harm others, responses that allude to drug abuse or sexual abuse or any response that would elicit concern for the student writing the response. Our neural network models have been designed to help identify these anomalous responses from a large collection of typical responses that students give. The responses identified by the neural network can be assessed for urgency, severity, and validity more quickly by a team of reviewers than otherwise possible. Given the anomalous nature of these types of responses, our goal is to maximize the chance of flagging these responses for review given the constraint that only a fixed percentage of responses can viably be assessed by a team of reviewers.

研究の動機と目的

  • 自由記述形式のオンライン評価における学生の警戒を要する反応(自己傷害や暴力の脅しなど)を自動で同定するシステムの開発を目的とする。
  • 従来の自動採点システムが見逃す、文脈依存的で微細な異常言語を検出する課題に対処することを目的とする。
  • 固定割合の反応しか手動でレビューできない制約下で、警戒検出率を最大化することを目的とする。
  • 教育的評価の高リスク環境における感度と誤検出のバランスを最適化することを目的とする。

提案手法

  • 本研究では、学生の反応における順序的テキストパターンをモデル化するため、再帰的ニューラルネットワーク(RNN)、特にGRUとLSTMを用いる。
  • モデルは単語埋め込みを用いて学習され、1,000件の警戒事例を含む保留セットを用いた5分割交差検証で評価される。
  • 文脈モデリングおよび長距離依存性の捉え込みを向上させるために、スタック型、双方向型、および注意メカニズムを組み合わせたアーキテクチャを採用する。
  • ハイパーパrameterチューニングは、再帰的ユニットのサイズ、スタックの深さ、双方向性、および注意メカニズムに焦点を当て、検出感度を最大化することを目的とする。
  • 性能は、レビュー閾値(1%から10%まで)を変化させた際の正しくフラグが付いた警戒事例の割合で測定される。
  • アンサンブルおよび集約されたモデル出力を用いることで、個々のモデルを上回る検出性能をさらに向上させる。

実験結果

リサーチクエスチョン

  • RQ1GRU、LSTM、およびそれらのスタック型、双方向型、または注意メカニズムを備えた変種のうち、どのRNNアーキテクチャが学生の反応における警戒検出性能を最も高めるか?
  • RQ2スタック、双方向性、注意メカニズムといったアーキテクチャ的要素が、それぞれ検出感度と誤検出率にどのように影響を与えるか?
  • RQ3深層学習モデルは、高精度で文脈的に微妙な警戒を要する反応(例:比喩的表現)を、非警戒的反応と効果的に区別できるか?
  • RQ4複数のアーキテクチャのアンサンブル平均を用いることで、モデル性能をどの程度向上させられるか?

主な発見

  • 注意メカニズムを備えた双方向スタックLSTMは、10%のレビュー率で98.7%の最高警戒検出率を達成した。
  • 2層の再帰的ユニット(128,128)をスタックすることで、性能向上が最大となり、単層モデルと比較して検出率が14.98%向上した。
  • 注意メカニズムの導入により、平均で4.15%の検出率向上が得られ、双方向モデル化により2.20%の向上が得られた。
  • 注意メカニズムを搭載しないスタックLSTMモデルは、10%のレビュー閾値で96.7%の検出率を達成し、強力なベースライン性能を示した。
  • LSTMベースのモデルは、GRUベースのモデルと比較して平均8.05%の検出精度で優れていた。
  • 集約されたモデル出力は、最良の個別モデルを上回る検出性能を示し、今後のアンサンブルベースの最適化に可能性を示唆した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。