[論文レビュー] Joint Multi-Domain Learning for Automatic Short Answer Grading
本稿では、大規模な外部コーパスに依存せずに、一括して汎用的言語特性とドメイン固有の類似性パターンを学習する、自動短回答採点のための共同マルチドメインディープラーニングアーキテクチャ、JMD-ASAGを提案する。限られたタスク固有のデータ上で、ドメイン固有および汎用の分類器をエンドツーエンドで共同訓練することで、ベンチマークおよび産業界データセットで最先端の性能を達成し、ドメイン固有および転移学習のベースラインを上回る。
One of the fundamental challenges towards building any intelligent tutoring system is its ability to automatically grade short student answers. A typical automatic short answer grading system (ASAG) grades student answers across multiple domains (or subjects). Grading student answers requires building a supervised machine learning model that evaluates the similarity of the student answer with the reference answer(s). We observe that unlike typical textual similarity or entailment tasks, the notion of similarity is not universal here. On one hand, para-phrasal constructs of the language can indicate similarity independent of the domain. On the other hand, two words, or phrases, that are not strict synonyms of each other, might mean the same in certain domains. Building on this observation, we propose JMD-ASAG, the first joint multidomain deep learning architecture for automatic short answer grading that performs domain adaptation by learning generic and domain-specific aspects from the limited domain-wise training data. JMD-ASAG not only learns the domain-specific characteristics but also overcomes the dependence on a large corpus by learning the generic characteristics from the task-specific data itself. On a large-scale industry dataset and a benchmarking dataset, we show that our model performs significantly better than existing techniques which either learn domain-specific models or adapt a generic similarity scoring model from a large corpus. Further, on the benchmarking dataset, we report state-of-the-art results against all existing non-neural and neural models.
研究の動機と目的
- 知能チューティングシステムにおける複数ドメインにわたる自動短回答採点(ASAG)の課題に対処すること。
- 大規模な外部コーパスに依存する既存のASAGモデルの限界を克服すること。
- 限られたタスク固有のデータから、ドメイン固有および汎用の言語特性を共同で学習する統一されたディープラーニングアーキテクチャの開発。
- 事前学習された汎用的言語モデルへの依存を排除し、タスクデータから直接普遍的な言語的特徴を学習すること。
提案手法
- JMD-ASAGは、kドメインに対して1つの共有汎用エンコーダーとk個のドメイン固有エンコーダーを持つ二重ブランチニューラルネットワークを採用する。
- モデルは、ドメイン固有および汎用の表現を用いて、学生の回答と基準回答間の類似度スコアを計算するシアンジア型アーキテクチャを採用する。
- バッチ単位でドメインを交互に切り替えながら、継続的忘却を防ぐために共同最適化目的関数を用いてエンドツーエンドで訓練する。
- シーケンス符号化に、タスクに合わせて微調整された事前学習済みGloVe埋め込み(300次元)と、100ユニットの双方向LSTMを使用する。
- ドメインをバッチごとにシッフティングすることで、バランスの取れた学習を確保し、以前に学習済みのドメインでの性能低下を防ぐ訓練プロトコルを提案する。
- モデルはカテゴリカル・クロスエントロピー損失と、固定学習率0.001で15エポックにわたりAdam最適化手法を用いて訓練される。
実験結果
リサーチクエスチョン
- RQ1大規模な事前学習コーパスに依存せずに、共同マルチドメイン学習フレームワークが、ドメイン固有または汎用のみのモデルを上回る性能を発揮できるか?
- RQ2ニューラルモデルが限られたタスク固有のデータから、普遍的な言語的特徴とドメイン固有の意味的パターンの両方を効果的に学習できるか?
- RQ3複数のドメインで共同学習を行う際、継続的忘却を回避しながら、性能を効果的に保持する最良の訓練戦略は何か?
- RQ4汎用的およびドメイン固有のコンponentをエンドツーエンドで共同学習することで、汎用的ソースドメインからの転移学習よりも優れた一般化性能が得られるか?
- RQ5提案されたアーキテクチャは、ベンチマークおよび実世界のASAGデータセットで最先端の性能を達成できるか?
主な発見
- ベンチマークデータセットでは、JMD-ASAGは、既存の非ニューラルおよびニューラルモデルをすべて上回る最先端の性能を達成した。
- 大規模な産業界データセットでは、JMD-ASAGはドメイン固有および転移学習のベースラインを著しく上回った。
- バッチ単位のドメインシャッフル訓練プロトコルが、最高のマクロ-F1(0.6703)と全体の正答率(0.7281)を達成し、エポック単位およびドメイン単位の訓練を上回った。
- ドメイン単位の訓練プロトコルでは、図4に示すように、以前に学習済みのドメインでの性能低下が進行した。これは継続的忘却に起因する。
- 実世界のパイロット導入において、1000人以上の学生を対象に5つのドメインにわたる性能が安定しており、一般化可能であった。
- アブレーションスタディの結果、汎用的およびドメイン固有の特徴を共同で学習することが、それらを別々に学習するか、転移学習で学習するのよりも効果的であることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。