Skip to main content
QUICK REVIEW

[論文レビュー] ALLURE: Auditing and Improving LLM-based Evaluation of Text using Iterative In-Context-Learning

Hosein Hasanbeig, Hiteshi Sharma|arXiv (Cornell University)|Sep 24, 2023
Topic ModelingComputer Science被引用数 3
ひとこと要約

ALLURE は、失敗モード固有の例を用いて GPT-4 の評価精度を改善する反復的イン・コンテキスト・ラーニング(ICL)を活用するクローズド・ループフレームワークである。実世界の応用における顕著な失敗モードに起因する、ターゲットされた ICL 例—特定のエラー種別に一致する例—が、人為的アノテーターへの依存を減らし、要約や強化学習計画タスクにおける耐性を著しく向上させることを示している。

ABSTRACT

From grading papers to summarizing medical documents, large language models (LLMs) are evermore used for evaluation of text generated by humans and AI alike. However, despite their extensive utility, LLMs exhibit distinct failure modes, necessitating a thorough audit and improvement of their text evaluation capabilities. Here we introduce ALLURE, a systematic approach to Auditing Large Language Models Understanding and Reasoning Errors. ALLURE involves comparing LLM-generated evaluations with annotated data, and iteratively incorporating instances of significant deviation into the evaluator, which leverages in-context learning (ICL) to enhance and improve robust evaluation of text by LLMs. Through this iterative process, we refine the performance of the evaluator LLM, ultimately reducing reliance on human annotators in the evaluation process. We anticipate ALLURE to serve diverse applications of LLMs in various domains related to evaluation of textual data, such as medical summarization, education, and and productivity.

研究の動機と目的

  • 実世界の応用における識別可能な失敗モードに起因する、LLM を用いたテキスト評価の監査と改善の重要性に対応する。
  • 自己生成された失敗モード固有の例を用いた体系的精錬により、LLM 評価者に対する人為的アノテーターへの依存を低減する。
  • GPT-4 を、強化学習計画やニュース要約を含む多様な分野における評価者として、耐性と正確性を向上させる。
  • ICL プロンプト設計—特に例の種別、数、クラスタリング—が評価者性能に与える影響を調査する。
  • 継続的な監査と改善が可能なスケーラブルなクローズド・ループプロトコルを構築する。

提案手法

  • 強化学習計画とニュース要約の2つの分野において、GPT-4 のテキスト評価出力を人為的アノテーションの真値と比較することで、その評価を監査し、失敗モードを同定する。
  • 顕著な評価のずれをメモリに保存し、エラー種別(例:事実の不一致、重複、不適切さ)に分類された失敗モードクラスタとして管理する。
  • GPT-4 の評価行動をガイドするため、特定の失敗モードクラスタから選択した例を用いてイン・コンテキスト・ラーニング(ICL)プロンプトを構築する。
  • 複数ラウンドにわたる反復的精錬を通じて ICL プロンプトセットを改善し、性能フィードバックと信号検出理論分析に基づいて例を更新する。
  • プロンプト設計の影響を評価するためのアブレーションスタディを実施し、例の数、例の種別、ガイダンス構造を含む。
  • 信号検出理論的アプローチを用いて、反復ごとの評価正確性の向上を定量化・分析する。

実験結果

リサーチクエスチョン

  • RQ1LLM を用いたテキスト評価における異なる種類の失敗モードが GPT-4 の性能に与える影響は何か? また、それらは体系的に分類可能か?
  • RQ2失敗モード固有の例を用いて微調整された ICL が、GPT-4 の評価正確性をどの程度向上させるか?
  • RQ3ICL の例の数は、評価性能に線形的か非線形的影響を及ぼすか? そして、改善の最適閾値は何か?
  • RQ4失敗モード例の異なるクラスタは、多様なテキスト生成タスクにおける GPT-4 評価の耐性と一般化能力にどのように影響するか?
  • RQ5例の選択に基づいて、ICL プロンプトを非対称的に性能向上させるように設計可能か? また、例のエラー種別への関連性はどのような役割を果たすか?

主な発見

  • 失敗モード固有の例を用いて ICL プロンプトを構築した場合、GPT-4 の評価性能は著しく向上し、ランダムまたは非ターゲット例選択に比べて性能向上が顕著であった。
  • ICL の例の数を増やすと、追加的な改善が得られるとは限らず、一定の閾値に達するまで一時的に性能が低下した後、改善が見られた。
  • ICL 例の種別—特に特定の失敗モードに一致する例—が、単純な例の数よりも性能に与える影響が顕著に強かった。
  • 「類似した」ICL 例の異なるセットが非対称的な改善をもたらしたため、失敗モードクラスタリングに基づく包括的な例選択が極めて重要であることが示された。
  • アブレーションスタディにより、命令の質とプロンプトガイダンスの両方が評価正確性に顕著な影響を及ぼすことが確認され、より構造化されたプロンプトが一貫した向上をもたらした。
  • 反復的 ICL プロトコルにより、失敗モードフィードバックループを通じた評価者の自己改善が可能となり、人為的アノテーターへの依存が低減した。このアプローチは、評価ワークフローにおけるスケーラビリティを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。