[論文レビュー] Evaluating the Factual Consistency of Large Language Models Through News Summarization
本稿では、大規模言語モデル(LLMs)の事実的一致性を測定するための新しい評価フレームワークFIB(Factual Inconsistency Benchmark)を紹介する。FIBは、事実的に整合的な要約と整合的でない要約の両方に高いスコアを割り当てるかどうかを評価することで、LLMsの事実的一致性を測定する。XSumおよびCNN/DMからの人間が検証済みの要約を用いて、23体のLLMs(1B〜176Bパラメータ)を評価した結果、大多数のモデルは整合的要約を好むが、しばしばソーステキストからコピーされた語句の一致が保たれた整合的でない要約を好むことが判明し、LLMsの事実性に関する深刻な失敗モードが浮き彫りになった。
While large language models (LLMs) have proven to be effective on a large variety of tasks, they are also known to hallucinate information. To measure whether an LLM prefers factually consistent continuations of its input, we propose a new benchmark called FIB(Factual Inconsistency Benchmark) that focuses on the task of summarization. Specifically, our benchmark involves comparing the scores an LLM assigns to a factually consistent versus a factually inconsistent summary for an input news article. For factually consistent summaries, we use human-written reference summaries that we manually verify as factually consistent. To generate summaries that are factually inconsistent, we generate summaries from a suite of summarization models that we have manually annotated as factually inconsistent. A model's factual consistency is then measured according to its accuracy, i.e.\ the proportion of documents where it assigns a higher score to the factually consistent summary. To validate the usefulness of FIB, we evaluate 23 large language models ranging from 1B to 176B parameters from six different model families including BLOOM and OPT. We find that existing LLMs generally assign a higher score to factually consistent summaries than to factually inconsistent summaries. However, if the factually inconsistent summaries occur verbatim in the document, then LLMs assign a higher score to these factually inconsistent summaries than factually consistent summaries. We validate design choices in our benchmark including the scoring method and source of distractor summaries. Our code and benchmark data can be found at https://github.com/r-three/fib.
研究の動機と目的
- テキスト生成における広範な事実の空想(factual hallucinations)の問題に対処すること。
- 特に要約タスクにおいて、LLMsの事実的一致性を測定する信頼性のあるベンチマークを構築すること。
- 多様なモデルサイズやアーキテクチャを想定して、LLMsが事実的に整合的でない要約と整合的な要約をどのように区別できるかを評価すること。
- モデルのスケーリング、スコアリング手法、または整合的でない要約の出典が、事実的一致性の検出に与える影響を調査すること。
提案手法
- XSumおよびCNN/DMデータセットから抽出された3,500組以上の手動でアノテートされた要約ペア(事実的に整合的で、事実的に整合的でないもの)を用いたFIBというベンチマークを提案。
- 人間が作成した参照要約を、事実的正確性が検証済みの事実的に整合的なゴールドスタンダードとして使用。
- 22体の事前学習済み要約モデルを用いて事実的に整合的でない要約を生成し、その後手動でアノテートして不整合であることを確認。
- LLMが事実的に整合的な要約に対して高いスコア(対数尤度またはPMIを用いて)を割り当てるかどうかを評価することで、事実的一致性を測定。
- 6つのモデルファミリー(BLOOM、OPT、GPT、T0など)に属する23体のLLMsを、条件付き対数尤度(LL)、長さ正規化済みLL、PMI、長さ正規化済みPMIの複数のスコアリング関数でテスト。
- 不整合要約の出典(編集なしの参照、FactCCで編集済み、MFMA生成)およびスコアリング関数に関するアブレーションスタディを実施し、ベンチマーク設計の妥当性を検証。
実験結果
リサーチクエスチョン
- RQ1大規模言語モデルは、ニュース要約タスクにおいて、事実的に整合的な要約を事実的に整合的でない要約よりも好むのか?
- RQ2モデルスケール(1B〜176Bパラメータ)が、事実的一致性検出に与える影響は何か?
- RQ3不整合要約の出典(例:モデル生成、FactCCで編集済み、ドキュメントからそのままコピー)が、LLMsの不整合検出能力に影響を与えるか?
- RQ4異なるスコアリング関数(LL、PMIなど)が、事実的一致性検出の正確性に与える影響は何か?
- RQ5ソースドキュメントにそのままでコピーされた語句を含む事実的に整合的でない要約が、LLMsを欺き、正しい要約よりも好まれるのか?
主な発見
- BLOOM(176B)は、事実的に整合的な要約に対して72.4%の割合で高いスコアを割り当てており、正確性を好む傾向が一般的に見られることが示された。
- 不整合要約がソースドキュメントから語句そのままでコピーされた場合、BLOOMはその9.6%の割合でそれを好むことが判明し、重大な失敗モードであることが明らかになった。
- 大規模モデル(例:OPT-175B)は事実的一致性が向上し、整合的・不整合的要約の選択において50.0%の正確性を示した。
- FactCCで生成された不整合要約は、モデル生成の不整合要約と同程度の割合で一部のLLMsを欺くことが判明し、耐性の課題が浮き彫りになった。
- 長さ正規化済みPMIスコアリング関数が、複数のモデルにおいて他の関数よりも事実的一致性の検出に優れていた。
- GPT-Neo-2.7BやGPTJ-6Bといったモデルは、語句そのままでコピーされた不整合要約に対してそれぞれ7.7%の正確性にとどまり、コピーペーストアーティファクトに脆弱であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。