Skip to main content
QUICK REVIEW

[論文レビュー] Measuring Reliability of Large Language Models through Semantic Consistency

Harsh Raj, Domenic Rosati|arXiv (Cornell University)|Nov 10, 2022
Topic Modeling被引用数 9
ひとこと要約

本論文は、自由形式のテキスト生成における大規模言語モデル(LLMs)の評価のための意味的整合性メトリクスを提案する。従来の語彙的等価性の代わりに、並記検出や自然言語帰納の意味的同等関数を用いる。この手法は語彙的メトリクスよりも人間の判断と著しく相関が高く、一貫性の欠如の主な要因はモデルサイズや正確性ではなく、デコード戦略であることが明らかになった。

ABSTRACT

While large pretrained language models (PLMs) demonstrate incredible fluency and performance on many natural language tasks, recent work has shown that well-performing PLMs are very sensitive to what prompts are feed into them. Even when prompts are semantically identical, language models may give very different answers. When considering safe and trustworthy deployments of PLMs we would like their outputs to be consistent under prompts that mean the same thing or convey the same intent. While some work has looked into how state-of-the-art PLMs address this need, they have been limited to only evaluating lexical equality of single- or multi-word answers and do not address consistency of generative text sequences. In order to understand consistency of PLMs under text generation settings, we develop a measure of semantic consistency that allows the comparison of open-ended text outputs. We implement several versions of this consistency metric to evaluate the performance of a number of PLMs on paraphrased versions of questions in the TruthfulQA dataset, we find that our proposed metrics are considerably more consistent than traditional metrics embodying lexical consistency, and also correlate with human evaluation of output consistency to a higher degree.

研究の動機と目的

  • 自由形式のテキスト生成におけるLLMの信頼できる一貫性評価の欠如に応えるため、語彙的等価性が意味的同等性を捉えきれない分野で、意味的同等性を捉える。
  • 正確なトークン一致にとどまらず、モデル出力間の真の意味的合意を測る、意味的整合性フレームワークを構築する。
  • モデルアーキテクチャ、サイズ、デコード戦略が自然言語生成における一貫性に与える影響を評価する。
  • 提案されたメトリクスを人間の判断と照合し、既存の語彙的ベースの整合性測定と比較する。

提案手法

  • 正確なトークン等価性の代わりに、出力間の意味的同等性を測る意味的合意関数 f(y_i, y_j) を用いる一般化された整合性メトリクス Cons_sem(Y) を提案する。
  • 4つの意味的合意関数を実装:意味的類似度に向けた BERTScore、並記検出(PP)、MNLI で微調整された DeBERTa-v2-xxlarge を用いた帰納/矛盾分類。
  • TruthfulQA データセットの並記化された質問を用い、さまざまなデコード手法を用いた複数のLLM(例:OPT、LLaMA)を評価する。
  • スピアマンの順位相関を用い、整合性スコアを人間のアノテーションと比較し、提案メトリクスの妥当性を評価する。
  • 複数メトリクス評価戦略を採用し、語彙的ベースライン(ROUGE-1、NER)と意味的メトリクス(PP、帰納、BERTScore)を比較する。
  • 再現性およびベンチマークのための並記化された TruthfulQA 質問の新規データセットを提供する。

実験結果

リサーチクエスチョン

  • RQ1意味的整合性メトリクスは、人間の出力の一貫性判断と比較して、語彙的ベースのメトリクスと比べてどの程度相関が高いか?
  • RQ2モデルサイズは自由形式のテキスト生成における意味的整合性にどの程度影響を及ぼすか?
  • RQ3異なるデコード戦略(例:グリーディ vs. ヌクレアスサンプリング)は意味的整合性にどのように影響するか?
  • RQ4正確性と一貫性はLLMにおいて直交的性質か、それとも相関関係にあるか?

主な発見

  • 帰納ベースの整合性メトリクスが人間の判断と最も強い相関を示した(ρ = 0.70)。語彙的メトリクス(ROUGE-1:ρ = 0.32、NER:ρ = 0.15)を著しく上回った。
  • 並記検出(PP)および BERTScore も人間スコアと中程度から強い相関を示した(それぞれ ρ = 0.52 および ρ = 0.54)。意味的整合性を捉える有効性が裏付けられた。
  • グリーディデコードは、全意味的整合性メトリクスにおいてヌクレアスサンプリングよりも著しく一貫性の高い出力を生成した。デコード戦略が一貫性欠如の主な要因であることが浮き彫りになった。
  • モデルサイズと正確性は一貫性と相関しない:大きなモデルはより一貫性が高いが、正確性はサイズの増加に伴い低下(逆比例)するため、これらは直交的性質である。
  • 語彙的メトリクス(ROUGE-1、NER)は人間の判断と弱い相関を示した(ρ ≤ 0.32)。意味的整合性の代理として不適切である。
  • 特に帰納および並記検出を用いた提案された意味的整合性フレームワークは、テキスト生成におけるLLMの信頼性をより信頼性高く、人間の判断と整合性を保った評価を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。