[論文レビュー] Multiple-Choice Questions are Efficient and Robust LLM Evaluators
本論文は、GSM8K や MATH といったオープンエンド LLM 評価ベンチマークを、50 以上のオープンソースモデルから正しい回答と誤った予測を収集することで、妥当な誤答(distractor)を備えた複数選択(MC)形式に変換する手法を提案している。この方法により、モデルのログ確率から直接予測を抽出することで、評価時間を最大 30 倍短縮しつつ、元のベンチマーク性能と高い相関(r > 0.9)を維持する。これは、誤答の選択肢や選択肢の順序にかかわらず安定した性能を示す。
We present GSM-MC, a multiple-choice (MC) dataset constructed by collecting answers and incorrect predictions on GSM8K from 60 open-source models. Through extensive experiments, we show that LLMs' performance on the MC version of this popular benchmark is strongly correlated with their performance on the original version and is quite robust to distractor choices and option orders, while the evaluation time is reduced by a factor of up to 30. Following similar procedures, we introduce MATH-MC, constructed from MATH, and PythonIO, a new program reasoning MC dataset constructed from HumanEval and MBPP. Experimental results indicate that LLMs' performance on these MC benchmarks leaves much room for improvement. Our data and code are available at https://github.com/Geralt-Targaryen/MC-Evaluation.
研究の動機と目的
- GSM8K や MATH といったオープンエンドベンチマークにおける不正な回答やフォーマットが誤った回答の問題に対処する。
- モデル生成からのヒューリスティックな回答抽出に起因する誤検出(false negatives)を低減し、評価時間を短縮する。
- 複数選択形式と、モデル予測から収集した洗練された誤答(distractor)を活用することで、LLM 評価の堅牢性を向上させる。
- コード生成ベンチマークに対しても、複数選択評価のパラダイムを拡張するため、プログラム出力予測タスク(PythonIO)を導入する。
- 複数選択評価が、標準的なオープンエンド評価と比較して信頼性が高く、効率的で、堅牢な代替手段であることを示す。
提案手法
- GSM8K および MATH のタスクに対して 50 以上のオープンソース LLM から正しい回答と誤った予測を抽出し、GSM-MC および MATH-MC を構築する。
- モデルが生成した誤った回答を誤答(distractor)として使用し、意味的に妥当な選択肢を形成する。
- 元の問題を 4~8 個の選択肢を持つ複数選択形式に再フォーマットし、一貫性のある構造と回答形式を保証する。
- HumanEval および MBPP をプログラム出力予測タスクに変換することで、PythonIO を開発し、モデルが複数の選択肢の中から正しい出力を選択するようにする。
- モデルのログ確率から直接予測を抽出することで、生成テキストのパースに起因するエラーを回避し、LLM を MC 形式で評価する。
- 誤答の数、誤答のセット、選択肢の順序の並び替えを変化させた系統的なアブレーションスタディを実施し、評価の堅牢性を検証する。
実験結果
リサーチクエスチョン
- RQ1GSM8K や MATH といったオープンエンドベンチマークを複数選択形式に変換することで、元のベンチマークとのモデル性能の相関を維持できるか?
- RQ2誤答の品質や選択肢の順序に変化が生じた場合でも、複数選択評価はどれほど堅牢か?
- RQ3標準的なオープンエンド生成と比較して、複数選択評価はどれほど評価時間を短縮できるか?
- RQ4複数選択評価のパラダイムは、HumanEval や MBPP のようなコード生成ベンチマークに対しても効果的に拡張可能か?
- RQ5複数選択評価は、フォーマットが誤っている、または無効な出力を生成するモデルによる誤検出(false negatives)を軽減できるか?
主な発見
- GSM-MC および MATH-MC における LLM の性能は、全テスト対象のモデルサイズおよび設定において、元の GSM8K および MATH ベンチマークとの間に強い相関(r > 0.9)を示す。
- 複数選択評価は誤答の変動や選択肢の順序にかかわらず堅牢であり、異なるモデルの予測から得た誤答に置き換えられても性能の安定性が維持される。
- 生成テキストのパース処理を避ける代わりに、モデルのログ確率から直接予測を抽出することで、評価時間を最大 30 倍短縮できる。
- 提案された PythonIO データセットにより、コード生成モデルの評価が複数選択形式で効率的かつ正確に行えるようになり、コード生成に起因するパースエラーを回避できる。
- インstruct fine-tuned モデルでは、オープンエンド形式で無効な回答が著しく増加するが、複数選択形式への変換により、出力形式の標準化によりこの問題が緩和される。
- 2 つの選択肢すら存在する状況でも、本手法は高い評価の正確性を維持しており、さまざまな複数選択構成においてスケーラビリティと信頼性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。