[論文レビュー] Automated Scoring for Reading Comprehension via In-context BERT Tuning
本稿では、構造化された入力プロンプトを用いて項目固有の文脈を統合する共有モデルを採用し、読解記述回答の自動採点のための文脈内BERT微調整を提案する。この手法は、項目間で共通の本文および質問文脈を活用することで、LMベースおよび非LMベースのベースラインを上回り、最先端の性能を達成した。また、わずかな人種的・性的指向に関するバイアスを示した。
Automated scoring of open-ended student responses has the potential to significantly reduce human grader effort. Recent advances in automated scoring often leverage textual representations based on pre-trained language models such as BERT and GPT as input to scoring models. Most existing approaches train a separate model for each item/question, which is suitable for scenarios such as essay scoring where items can be quite different from one another. However, these approaches have two limitations: 1) they fail to leverage item linkage for scenarios such as reading comprehension where multiple items may share a reading passage; 2) they are not scalable since storing one model per item becomes difficult when models have a large number of parameters. In this paper, we report our (grand prize-winning) solution to the National Assessment of Education Progress (NAEP) automated scoring challenge for reading comprehension. Our approach, in-context BERT fine-tuning, produces a single shared scoring model for all items with a carefully-designed input structure to provide contextual information on each item. We demonstrate the effectiveness of our approach via local evaluations using the training dataset provided by the challenge. We also discuss the biases, common error types, and limitations of our approach.
研究の動機と目的
- 個々の項目ごとに別々のモデルを訓練する必要がある従来の自動採点モデルのスケーラビリティおよび文脈活用の制限を解消すること。
- 読解記述回答のための統合的かつスケーラブルな採点モデルを構築し、項目間で共通の本文および質問文脈を活用すること。
- 文脈豊富な入力フォーマットを設計することで、別々のモデルを必要とせずにBERTを文脈内微調整可能にし、採点精度を向上させること。
- 実世界の教育的評価環境において、モデルの性能、誤りパターン、および異なる人種的・性的指向グループにおける公平性を評価すること。
提案手法
- 各項目について、本文、質問、および例題の回答とその採点を含むプロンプトを構築し、事前学習済みBERTモデルを文脈内微調整する。
- 構造化された入力フォーマットを用いて、各ターゲット回答の文脈的情報を埋め込むことで、すべての項目を同時に微調整する共有BERTモデルを採用する。
- 入力フォーマットには、質問、いくつかの文脈内例(正解スコア付き)、および学生の回答が含まれており、これらがすべて1つのシーケンスに連結される。
- モデルは、この文脈豊富な入力に基づいて学生の回答の人的採点スコアを予測するように訓練され、新しい項目に対してもゼロショット一般化が可能になる。
- 公平性の分析のため、性別や人種などのデモグラフィック情報を、例として「女性ア시アン学生が書いた回答を採点してください」といったプレフィックスプロンプトとしてオプションで追加する。
- 精度向上のため、後処理としてスペルチェックを実施し、モデルの解釈可能性を分析するためにアテンションマップを用いる。
実験結果
リサーチクエスチョン
- RQ1別々の項目ごとに微調整を行わない1つの共有BERTモデルが、複数の読解記述項目で高い採点精度を達成できるか?
- RQ2構造化されたプロンプトを用いた文脈内微調整は、パラメータを共有しつつ、項目固有の文脈をどれほど的確に捉えられるか?
- RQ3モデルが一般的に犯す誤りの種類は何か?文法、主観性、共参照など言語的特徴とどのように関連しているか?
- RQ4モデルは異なる学生のデモグラフィックグループに対してどの程度バイアスを示すか?また、入力にデモグラフィック情報を含めることで公平性に影響を与えるか?
- RQ5完全な本文にアクセスしない状況でも、モデルは新しい項目に一般化可能か?この制限が読解能力に与える影響は?
主な発見
- 提案手法である文脈内BERT微調整は、NAEPトレーニングデータセットにおいて、従来のLMベースおよび非LMベースの自動採点ベースラインを上回った。
- 別々のモデルを必要とせず、スケーラビリティが著しく向上し、ストレージ要件も削減された。
- 一般的な誤りタイプには、綴り・文法ミス、主観的解釈、まれな正解、誤った回答を模倣するものがあり、特に低スコアの例を模倣する場合に顕著だった。
- モデルはわずかなバイアスを示しており、大多数のデモグラフィックグループではスコアを過大評価していたが、特に4年生のパシフィック・アイルランドーズ/アメリカン・インディアンのグループでは、学習データ量が少なかったため、例外的だった。
- 入力にデモグラフィック情報を含めることでバイアスパターンがわずかに変化したが、依然として避けがたいが小さなバイアスがグループ間で見られた。
- スペルチェックによる前処理は採点精度を向上させ、BERTを固定のテキストエンコーダーとして使用するのではなく、微調整することで著しく効果的だった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。