Skip to main content
QUICK REVIEW

[論文レビュー] Assessing the Reliability of Large Language Model Knowledge

Weixuan Wang, Barry Haddow|arXiv (Cornell University)|Oct 15, 2023
Topic ModelingComputer Science被引用数 3
ひとこと要約

本稿では、さまざまなプロンプトや文脈における出力確率分布の一貫性を測定することで、大規模言語モデル(LLM)の事実的信頼性を評価する新しい指標であるMONITORを提案する。精度との間に強い相関(ピアソン相関係数0.846)を示し、計算コストを2.97倍削減するとともに、事実的知識評価のための公開データセットFKTCを提供する。

ABSTRACT

Large language models (LLMs) have been treated as knowledge bases due to their strong performance in knowledge probing tasks. LLMs are typically evaluated using accuracy, yet this metric does not capture the vulnerability of LLMs to hallucination-inducing factors like prompt and context variability. How do we evaluate the capabilities of LLMs to consistently produce factually correct answers? In this paper, we propose MOdel kNowledge relIabiliTy scORe (MONITOR), a novel metric designed to directly measure LLMs' factual reliability. MONITOR computes the distance between the probability distributions of a valid output and its counterparts produced by the same LLM probing the same fact using different styles of prompts and contexts.Experiments on a comprehensive range of 12 LLMs demonstrate the effectiveness of MONITOR in evaluating the factual reliability of LLMs while maintaining a low computational overhead. In addition, we release the FKTC (Factual Knowledge Test Corpus) test set, containing 210,158 prompts in total to foster research along this line (https://github.com/Vicky-Wil/MONITOR).

研究の動機と目的

  • 異なるプロンプトや文脈下でのLLM精度指標の不安定性、特に幻覚化の脆弱性を捉えられない問題に対処すること。
  • 出力確率分布の分析を通じて、LLMの事実的知識における不確実性を捉える高分解能の指標を開発すること。
  • さまざまなモデルにおいて、プロンプトフレーミングと文脈内干渉の組み合わせ効果がLLMの信頼性に与える影響を評価すること。
  • 事実的知識評価における計算負荷を低減しつつ、高い信頼性評価の正確性を維持すること。
  • LLMの事実的信頼性に関する再現可能な研究を支援するため、FKTCデータセット(210,158プロンプト)を公開すること。

提案手法

  • MONITORは、同じ事実を異なるプロンプトスタイルおよび文脈入力でプローブした際の出力確率分布間の距離を計算する。
  • 確率分布の乖離を測定するために、ジェンセン・シャノン発散(JSD)を用い、これが事実的信頼性の代理指標として機能する。
  • この手法は、質疑応答(QA)、語の予測(WP)、事実確認(FC)の3つのタスクにおいてLLMを評価する。
  • 統合勾配を用いてモデル出力を入力特徴に帰属づけ、文脈内干渉効果を分析する。
  • MONITORは、完全な精度評価に比べてGPU時間の約1/3で計算可能であり、スケーラブルな評価が可能になる。
  • LLaMA-30b-insやBLOOMZシリーズを含む、サイズやインstruct微調整状態が異なる12種類のLLMでフレームワークを検証した。

実験結果

リサーチクエスチョン

  • RQ1多様なプロンプト条件下で、MONITORは標準的な精度指標とどの程度相関するか?
  • RQ2完全な精度ベースの信頼性評価と比較して、MONITORは計算コストをどの程度削減できるか?
  • RQ3プロンプトフレーミングと文脈内干渉は、LLMの事実的出力の一貫性にどのように影響するか?
  • RQ4スケール法則に従い、より大きなLLMはMONITORで測定された事実的信頼性が高くなるか?
  • RQ5異なるプロンプト設定においてMONITORが一貫性を示すか、多様なプロンプトスタイルへの一般化性があるか?

主な発見

  • MONITORは12種類のLLM全体で平均精度とピアソン相関係数0.846を示し、標準的評価と高い整合性を示している。
  • MONITORを用いることで、完全な精度評価と比較してGPU時間を2.97倍削減し、顕著な計算コストの削減が達成された。
  • 統合勾配帰属づけによる分析から、MONITOR値が低いモデル(例:OPT-2b7は0.471)は、文脈内干渉に対して感受性が低いことが示された。
  • BLOOMZおよびVicunaモデルは、MONITORスコアにおいてスケール法則に従っており、20のテストデータセット全体で、より大きなモデルが一貫して低いMONITOR値(高い信頼性)を示した。
  • 異なるプロンプトグループ化においてMONITORの結果が一貫しており、7プロンプトと4プロンプトのサブセット間で強い線形相関(r ≈ 0.95)が観察された。
  • 210,158プロンプトを含むFKTCデータセットが公開され、LLMの事実的信頼性に関する再現可能な評価が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。