Skip to main content
QUICK REVIEW

[論文レビュー] Large Language Models are Not Yet Human-Level Evaluators for Abstractive Summarization

Chenhui Shen, Liying Cheng|arXiv (Cornell University)|May 22, 2023
Topic Modeling被引用数 5
ひとこと要約

本稿では、要約抽出要約の自動評価者としての大型言語モデル(LLM)であるChatGPTやGPT-4の評価を検証し、従来のメトリクスを上回るが、候補要約や次元依存のバイアスのため、特に高品質な要約では一貫性に欠け、人間の判断との相関が低下するため、信頼性に欠けることが判明した。

ABSTRACT

With the recent undeniable advancement in reasoning abilities in large language models (LLMs) like ChatGPT and GPT-4, there is a growing trend for using LLMs on various tasks. One area where LLMs can be employed is as an alternative evaluation metric for complex generative tasks, which generally demands expensive human judges to complement the traditional automatic metrics for various evaluation dimensions such as fluency and consistency. In this work, we conduct extensive analysis to investigate the stability and reliability of LLMs as automatic evaluators for abstractive summarization. We found that while ChatGPT and GPT-4 outperform the commonly used automatic metrics, they are not ready as human replacements due to significant limitations. That is, LLM evaluators rate each candidate system inconsistently and are dimension-dependent. They also struggle to compare candidates with close performance and become more unreliable with higher-quality summaries by obtaining a lower correlation with humans. In other words, with better abstractive summarization systems being introduced at a fast pace, LLMs may result in misleading and unreliable evaluations.

研究の動機と目的

  • LLMが要約抽出要約システムの評価において人間のアノテーターに代替可能かどうかを評価すること。
  • 異なる要約システムおよび評価次元において、LLMベースの評価の安定性と一貫性を調査すること。
  • LLM評価者が優れた要約モデルを区別する能力の限界を同定すること。
  • 人間による検証が必要になる前に、信頼性の低いLLM評価を検出する実用的で一時的なフレームワークを提案すること。

提案手法

  • リッカート尺度評価(直接的根拠提示→スコア付与および複数選択式質問の提示)と、ヘッド・トゥ・ヘッド(H2H)比較の2つの人的評価パラダイムを採用した。
  • ChatGPTおよびGPT-4を用いて、12の要約抽出要約システム(各100件の生成要約を含む)のスコアと好みを生成した。
  • 熟語性、一貫性、整合性、関連性の各次元において、LLMスコアと平均的人間専門家判断との相関を計算した。
  • 要約品質が向上するにつれてLLMの信頼性がどのように変化するかを評価するためのメタ相関指標を導入した。
  • 根拠提示→スコア付与(RTS)と複数選択式質問(MCQ)の2つのプロンプト戦略の間の合意度を用いた信頼性チェックを提案:合意度が低い場合、信頼性の欠如の兆候である。
  • すべてのLLM出力とコードを https://github.com/DAMO-NLP-SG/LLM_summeval で公開し、再現性を確保した。

実験結果

リサーチクエスチョン

  • RQ1LLMベースの評価者が、異なる要約抽出要約システムにおいて、人間の判断との相関性においてどのように比較されるか?
  • RQ2LLM評価者が、異なる評価次元で同じシステムを評価する際、どの程度一貫性を示すか?
  • RQ3高品質な要約と低品質な要約を比較した場合、LLM評価者の性能はどのように変化するか?
  • RQ4根拠提示→スコア付与(RTS)と複数選択式質問(MCQ)の2つのプロンプト戦略の合意度は、LLM評価の信頼性を信頼できる指標として機能するか?
  • RQ5LLM評価に系統的なバイアスがあり、それが要約候補や評価次元に依存しているか?

主な発見

  • LLM評価者(ChatGPTおよびGPT-4)は、ROUGE や BARTScore といった従来の自動メトリクスよりも、人間の判断との相関性が優れている。
  • LLM評価者は、異なる候補要約を評価する際、顕著な不一致を示しており、これは候補依存バイアスを示している。
  • LLM評価は次元依存的であり、熟語性、一貫性、整合性の各次元で人間の判断との一致度が異なる。
  • 要約品質が向上するにつれて、LLM評価者は人間の判断との相関が低下する—これを「ネガティブ・メタ相関」と呼ぶ。
  • 根拠提示→スコア付与(RTS)と複数選択式質問(MCQ)の2つのプロンプト戦略の合意度は、評価の信頼性と相関している:合意度が低い場合、人間による検証の必要性を示唆する。
  • RTS-MCQ合意度による提案された信頼性チェックは、関連性次元では効果がなく、有意な相関が確認されなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。