Skip to main content
QUICK REVIEW

[論文レビュー] Automatic Short Math Answer Grading via In-context Meta-learning

Mengxue Zhang, Sami Baral|arXiv (Cornell University)|May 30, 2022
Online Learning and Analytics被引用数 12
ひとこと要約

本論文は、微調整されたMathBERTを用いて、推論時にスコア例をコンテキストとして組み込むことで、数学教育における自動短回答採点のための新しい文脈内メタラーニングフレームワークを提案する。このアプローチにより、未学習の質問に対しても優れた一般化性能を達成し、従来手法を著しく上回るが、質問ごとのモデル訓練を回避し、ドメイン特化された言語理解を活用する。

ABSTRACT

Automatic short answer grading is an important research direction in the exploration of how to use artificial intelligence(AI)-based tools to improve education. Current state-of-the-art approaches use neural language models to create vectorized representations of students' responses, followed by classifiers to predict the score. However, these approaches have several key limitations, including i) they use pre-trained language models that are not well-adapted to educational subject domains and/or student-generated text and ii) they al-most always train one model per question, ignoring the link-age across questions and resulting in a significant model storage problem due to the size of advanced language models. In this paper, we study the problem of automatic short answer grad-ing for students' responses to math questions and propose a novel framework for this task. First, we use MathBERT, a variant of the popular language model BERT adapted to mathematical content, as our base model and fine-tune it on the downstream task of student response grading. Second, we use an in-context learning approach that provides scoring examples as input to the language model to provide additional context information and promote generalization to previously unseen questions. We evaluate our framework on a real-world dataset of student responses to open-ended math questions and show that our framework (sometimes significantly) outperforms existing approaches, especially for new questions that are not seen during training.

研究の動機と目的

  • 数学的コンテンツに不適切な質問特化型モデルや汎用言語モデルに依存する既存の自動短回答採点(ASAG)システムの限界を是正する。
  • すべての質問で共通のモデルパラメータを用いることで、文脈内学習を活用し、これまでにない数学的質問への一般化を向上させる。
  • 数学的テキストと式に事前に微調整されたBERTの変種であるMathBERTを用いることで、学生の回答の記号的および言語的側面をよりよく捉える表現を向上させる。
  • 1つの共有モデルを訓練することで、質問ごとのモデル管理の負荷を軽減し、教育プラットフォームにおけるスケーラブルな展開を可能にする。

提案手法

  • 数学的コンテンツで事前に学習されたBERTベースの言語モデル、MathBERTを、実世界の学生の数学的質問に対する回答のデータセットで微調整する。
  • 質問、学生の回答、およびスコアが付与された複数の例の回答を含む構造化された入力フォーマットを設計し、文脈内デモンストレーションとして使用する。
  • 推論時に少数の文脈内例を用いて、新しい質問に素早く適応できるように、メタラーニングの原則を適用する。
  • 同じモデルがすべての質問を処理する共有のマルチタスク学習設定を採用し、コンテキスト例がタスク固有のガイダンスを提供する。
  • 質問の種別、スキル、正解の構造といった関連するコンテキストを入力プロンプト設計に組み込むことで、モデルの採点基準と人間の採点基準の整合性を高める。
  • モデルのアテンションメカニズムを活用し、新しい回答のスコア予測時に文脈内例の関連性を重み付けする。

実験結果

リサーチクエスチョン

  • RQ1文脈内学習を用いて、質問ごとの微調整なしに、新しい未学習の数学的質問に効果的に一般化できる、1つの共有モデルは可能か?
  • RQ2数学的特化の短回答採点において、標準のBERTと比較して、MathBERTをベースモデルとして用いることでスコア精度が向上するか?
  • RQ3回答例を含む文脈内学習は、特に珍しいまたは未学習の質問タイプにおいて、モデルのパフォーマンスにどのように影響するか?
  • RQ4本フレームワークの主な失敗モードは何か?特に数値的誤り、綴りのばらつき、言い換えられた回答の処理において。
  • RQ5スコア精度を維持または向上させながら、質問ごとのモデル訓練の必要性を削減できるか?

主な発見

  • 提案された文脈内メタラーニングフレームワークは、既存の最先端手法を著しく上回り、特に未学習の質問において顕著な一般化能力を示している。
  • MathBERTをベースモデルとして用いているにもかかわらず、初期設定では標準のBERTよりパフォーマンスが悪く、MathBERTを特定の採点タスクに適応させる上での課題が示された。
  • 文脈内学習のコンponent—特にスコアが付与された回答例を入力として提供すること—が、多様な質問にわたる効果的な一般化を可能にする主な要因であった。
  • 数値的推論の誤り(例:誤った演算子や逆転した数値の順序、「15*5=3」など)に対し、モデルはしばしば誤って高いスコアを付与する傾向があり、トークンレベルの類似性に起因する。
  • 「イコール」などの重要な用語の綴りミスは、人間の採点者が数学的意味を明確に理解している場合でも、不正なスコアペナルティを引き起こす。
  • 「私はそれがそうだと思います」などの不要なフレーズが含まれる言い換えられた回答は、ノイズの影響を受けて誤分類されるため、意味的コンテンツではなく言語的変動に敏感であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。