[論文レビュー] Can AI grade your essays? A comparative analysis of large language models and teacher ratings in multidimensional essay scoring
本研究では、ドイツ教育における多次元的エッセイ採点について、オープンソースおよびクローズドソースの大規模言語モデル(LLM)を評価し、37名の教員が10の基準で採点した結果と比較した。新規のo1モデルは、高い信頼性(ICC = .80)と強い相関(スピアマンの順位相関係数 r = .74)を示し、人間の採点と一致したが、特に言語関連の基準で優れた性能を発揮した。一方、全体的な得点が高めに評価される傾向にあり、コンテンツの質の評価の改善が求められることが示された。
The manual assessment and grading of student writing is a time-consuming yet critical task for teachers. Recent developments in generative AI, such as large language models, offer potential solutions to facilitate essay-scoring tasks for teachers. In our study, we evaluate the performance and reliability of both open-source and closed-source LLMs in assessing German student essays, comparing their evaluations to those of 37 teachers across 10 pre-defined criteria (i.e., plot logic, expression). A corpus of 20 real-world essays from Year 7 and 8 students was analyzed using five LLMs: GPT-3.5, GPT-4, o1, LLaMA 3-70B, and Mixtral 8x7B, aiming to provide in-depth insights into LLMs' scoring capabilities. Closed-source GPT models outperform open-source models in both internal consistency and alignment with human ratings, particularly excelling in language-related criteria. The novel o1 model outperforms all other LLMs, achieving Spearman's $r = .74$ with human assessments in the overall score, and an internal consistency of $ICC=.80$. These findings indicate that LLM-based assessment can be a useful tool to reduce teacher workload by supporting the evaluation of essays, especially with regard to language-related criteria. However, due to their tendency for higher scores, the models require further refinement to better capture aspects of content quality.
研究の動機と目的
- ドイツ語の学生エッセイを複数の次元で採点する際の、大規模言語モデル(LLM)の信頼性と妥当性を評価すること。
- オープンソースおよびクローズドソースのLLMが、10の事前に定義された基準において人間の教員の採点と比較してどのように機能するかを評価すること。
- 教育的エッセイ採点におけるLLMの内部整合性と人間の評価との一致度を評価すること。
- 特に言語的品質とコンテンツの質の評価における、LLMの強みと限界を特定すること。
- 教員の負担を軽減しつつ、評価の質を維持できるAI支援エッセイ採点ツールの開発を支援すること。
提案手法
- 7年生および8年生の20編の実際のドイツ語エッセイから構成されるコーパスを、GPT-3.5、GPT-4、o1、LLaMA 3-70B、Mixtral 8x7Bの5つのLLMを用いて評価した。
- エッセイは、物語の論理、表現、言語の正確性などを含む10の事前に定義された基準に基づき、37名の教員によって採点された。
- LLMの評価はプロンプト工学を一切行わず、モデルの挙動を隔離し、一貫性を確保した。
- スピアマンの順位相関係数(r)および組内相関係数(ICC)などの統計的指標を用いて、一致度と内部整合性を評価した。
- 比較分析では、GPT-4 や o1 などのクローズドソースモデルと、LLaMA 3 や Mixtral などのオープンソースモデルとの間の性能差に注目した。
- 自動採点の信頼性と耐性を評価するために、複数回のLLM実行における分散を分析した。

実験結果
リサーチクエスチョン
- RQ1クローズドソースおよびオープンソースのLLMは、ドイツ語エッセイ採点における10の多次元的基準において、人間の教員の採点とどの程度一致するか。
- RQ2LLMが生成する採点の内部整合性はどの程度か。また、異なるモデル間でどのように変動するか。
- RQ3言語関連基準とコンテンツ関連基準の両方において、人間の教員の採点をどれほど正確に再現できるか。
- RQ4LLMは全体的な得点を高めに評価する傾向を示しており、教育現場における信頼性にどのような影響を与えるか。
- RQ5LLMはどのようにしてコンテンツの質の評価を改善し、人間の評価基準と一致させることができるか。
主な発見
- o1モデルは、人間の採点との相関が最も高く(スピアマンの順位相関係数 r = .74)、内部整合性も最も強かった(ICC = .80)、他のすべてのモデルを上回った。
- 特にGPT-4とo1といったクローズドソースモデルは、人間の採点との一致度と内部整合性の両面で、オープンソースモデルを著しく上回った。
- LLaMA 3-70B や Mixtral 8x7B といったオープンソースモデルは、分散は小さかったが人間の採点との相関が弱く、多次元的評価において信頼性が低いことが示された。
- LLMは、表現や文法といった言語関連基準では優れた性能を示したが、物語の論理や主張の整合性といったコンテンツ関連基準では劣った。
- o1モデルの成績から、最新の推論最適化型LLMは人間の採点を非常に正確に模倣できることが示されたが、依然として全体的な得点を高めに評価する傾向がある。
- 本研究は、LLMのコンテンツの質の評価をさらに精錬し、採点バイアスを低減することで、人間の基準と一致させる必要があることを強調した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。