[論文レビュー] Which Prompts Make The Difference? Data Prioritization For Efficient Human LLM Evaluation
本稿では、KLダイバージェンスと交差エントロピーを用いてプロンプトをランク付けすることで、大規模言語モデルの人的評価を効率化するデータ優先戦略を提案する。この戦略により、優先度の高い20%のインスタンスにおいて、同着率を最大54%まで低減し、人的アノテーション作業を著しく削減しながら、安定したEloスコアを用いた性能ランキングを維持できる。
Human evaluation is increasingly critical for assessing large language models, capturing linguistic nuances, and reflecting user preferences more accurately than traditional automated metrics. However, the resource-intensive nature of this type of annotation process poses significant challenges. The key question driving our work: "is it feasible to minimize human-in-the-loop feedback by prioritizing data instances which most effectively distinguish between models?" We evaluate several metric-based methods and find that these metrics enhance the efficiency of human evaluations by minimizing the number of required annotations, thus saving time and cost, while ensuring a robust performance evaluation. We show that our method is effective across widely used model families, reducing instances of indecisive (or "tie") outcomes by up to 54% compared to a random sample when focusing on the top-20 percentile of prioritized instances. This potential reduction in required human effort positions our approach as a valuable strategy in future large language model evaluations.
研究の動機と目的
- 人的評価のリソース負担を軽減し、必要なアノテーション数を最小限に抑えること。
- ペairワイズ比較において、モデルの応答を最も効果的に区別できるプロンプトを特定すること。
- 人的評価における迷い(同着)結果を軽減し、時間の無駄を減らして評価の効率を向上させること。
- よりスマートなプロンプト選択により、Eloスコアを用いたモデルランク付けの頑健性と安定性を向上させること。
- 多様なモデルファミリーにスケーラブルな、体系的でオフラインのプロンプト優先戦略を開発すること。
提案手法
- モデルの完了結果間のKLダイバージェンスと交差エントロピーを用いて、類似度の推定を行い、プロンプトをランク付けする。
- 特に類似度が低いプロンプトを優先順位の高いものとして、人的評価に使用する。
- 人的評価者は、プロンプトごとにモデル応答を順位付けするペアワイズ比較形式を採用する。
- Eloスコアを用いてモデルランク付けを行い、評価シーケンス全体を通して収束性と安定性を追跡する。
- Flan-T5、Dolly-V2、MPT、Falconを含む複数のモデルファミリーで、本手法をベンチマークする。
- 優先戦略の有効性を孤立して評価するため、ランダムサンプリングと性能を比較する。
実験結果
リサーチクエスチョン
- RQ1どのプロンプトがペアワイズモデル比較において、最も決定的な人的判断を生むか?
- RQ2指標に基づくプロンプト優先戦略は、評価の信頼性を損なわず、人的アノテーションの必要数を削減できるか?
- RQ3プロンプト優先戦略により、人的評価における同着結果はどの程度削減されるか?
- RQ4プロンプトランク付けは、Eloベースのモデルランク付けの安定性と収束性にどのように影響するか?
- RQ5本手法は、アーキテクチャや学習データが異なる多様なモデルファミリーに一般化可能か?
主な発見
- 優先度の高い上位20%のプロンプトにおいて、ランダムサンプリングと比較して同着率を最大54%まで低減した。
- KLダイバージェンスに基づくランク付けが、交差エントロピーおよびランダム選択よりも、迷いの少ない結果をもたらす。
- 特に初期評価段階において、優先度の高いプロンプトを使用することで、Eloスコアの収束が速く、安定性が向上した。
- Flan-T5、Dolly-V2、MPT、Falconを含む多様なモデルファミリーにおいて、頑健な性能評価を維持できた。
- 同じファミリー内でのモデル比較(例:Dolly-V2-7B 対 12B)では同着率が高くなる傾向にあったが、優先戦略により効果的に低減された。
- 人的アノテーション数を著しく削減することで、信頼性の高いモデルランク付けが可能になった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。