[論文レビュー] Leveraging LLM-Respondents for Item Evaluation: a Psychometric Analysis
本研究では、教育的評価における項目尺度の標準化に、大規模言語モデル(LLM)を合成被験者として用いることの有効性を評価する。項目反応理論(IRT)を用いて、GPT-3.5およびアンサンブルLLMの応答が、人間の能力分布とよく一致し、人間による標準化データと高い相関(r > 0.87)を示すことが判明した。さらに、再サンプリングによるデータ拡張により相関が0.93に向上し、フォーマティブおよび summative 評価におけるスケーラブルで低コストな項目評価が可能になることが示された。
Effective educational measurement relies heavily on the curation of well-designed item pools (i.e., possessing the right psychometric properties). However, item calibration is time-consuming and costly, requiring a sufficient number of respondents for the response process. We explore using six different LLMs (GPT-3.5, GPT-4, Llama 2, Llama 3, Gemini-Pro, and Cohere Command R Plus) and various combinations of them using sampling methods to produce responses with psychometric properties similar to human answers. Results show that some LLMs have comparable or higher proficiency in College Algebra than college students. No single LLM mimics human respondents due to narrow proficiency distributions, but an ensemble of LLMs can better resemble college students' ability distribution. The item parameters calibrated by LLM-Respondents have high correlations (e.g. > 0.8 for GPT-3.5) compared to their human calibrated counterparts, and closely resemble the parameters of the human subset (e.g. 0.02 Spearman correlation difference). Several augmentation strategies are evaluated for their relative performance, with resampling methods proving most effective, enhancing the Spearman correlation from 0.89 (human only) to 0.93 (augmented human).
研究の動機と目的
- 心理的尺度モデリングを用いて、LLMが教育的評価における人間の応答パターンをどれだけ模倣できるかを評価すること。
- 人間の応答とLLMによって生成された応答を用いて標準化された項目の心理的特性を比較すること。
- 人間データと組み合わせたLLM応答データを用いたデータ拡張戦略が、標準化の正確性を向上させるかを評価すること。
- フォーマティブおよび summative 評価における迅速で低コストな項目キュレーションにLLMを用いる可能性を検討すること。
提案手法
- 20の大学代数項目(OpenStaxより取得)を、GPT-3.5、GPT-4、Llama 2、Llama 3、Gemini-Pro、Cohere Command R Plusの6つのLLMに提示し、各モデルから150件の応答を生成した。
- 項目反応理論(IRT)を用いて、人間およびLLM生成応答データから項目パラメータ(難易度、識別度)を標準化した。
- LLMで標準化された項目パラメータと人間で標準化されたパラメータの間のスピアーマンおよびピアソン相関を計算し、類似度を評価した。
- 3つの拡張戦略をテストした:直接結合、LLMデータの再サンプリング、再サンプリングしたLLMデータと人間データの1:1混合。
- 再サンプリングは、LLM被験者の能力分布の改善に用いられ、歪みを軽減し、人間の二峰性パターンに近づけた。
- モデルの性能は、相関係数、RMSE、人間ベースライン分布との比較を用いて評価された。

実験結果
リサーチクエスチョン
- RQ1RQ1: IRTで測定した数学的能力の観点から、どのLLMまたはLLMの組み合わせが人間被験者の能力を最もよく模倣するか?
- RQ2RQ2: LLM被験者を用いて標準化された項目の心理的特性は、人間被験者を用いて標準化されたものと比べてどうか?
- RQ3RQ3: 人間の応答データにLLM被験者のデータを加えることで、より大きな人間サンプルから得られる項目パラメータと同等の結果が得られるか?
主な発見
- GPT-3.5が人間被験者と最も類似しており、人間で標準化された項目パラメータとのスピアーマン相関が0.87に達した。
- 再サンプリング戦略を用いたLLMアンサンブルは、LLMと人間の標準化パラメータ間の相関を0.89(人間のみのデータ時)から0.93に向上させた。
- 単一のLLMでは人間の能力分布を完全に再現できなかったが、再サンプリングを組み合わせたアンサンブルは、人間の二峰性分布をよりよく近似した。
- 最も効果的な拡張戦略である「再サンプリングしたLLMデータと人間データの1:1混合」は、スピアーマン相関を0.04、ピアソン相関を0.01向上させたが、RMSEも上昇した。
- LLM被験者(GPT-3.5から150件の応答)が得た項目パラメータは、人間被験者50名分のデータと同等の相関(0.87)を示した。
- 本研究では、IRTを用いて複数のLLMにおける能力分布の新規かつ画期的な分析を実施し、点推定を越えて、能力スパン全体をモデル化する手法を提示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。