Skip to main content
QUICK REVIEW

[論文レビュー] Semantic Consistency for Assuring Reliability of Large Language Models

Harsh Raj, Vipul Gupta|arXiv (Cornell University)|Aug 17, 2023
Topic Modeling被引用数 4
ひとこと要約

本稿では、一時的類似性を越えて真の意味的同等性を捉えるために、大規模言語モデル(LLM)のオープンエンドテキスト生成を評価するための新しい意味的整合性メトリクスを導入する。意味的整合性の向上を図るためのAsk-to-Choose(A2C)プロンプト戦略を提案し、TruthfulQAにおいて正解率を最大47%向上、意味的整合性を最大7倍に高める。人間の判断と強く整合し、従来のメトリクスを上回る性能を示した。

ABSTRACT

Large Language Models (LLMs) exhibit remarkable fluency and competence across various natural language tasks. However, recent research has highlighted their sensitivity to variations in input prompts. To deploy LLMs in a safe and reliable manner, it is crucial for their outputs to be consistent when prompted with expressions that carry the same meaning or intent. While some existing work has explored how state-of-the-art LLMs address this issue, their evaluations have been confined to assessing lexical equality of single- or multi-word answers, overlooking the consistency of generative text sequences. For a more comprehensive understanding of the consistency of LLMs in open-ended text generation scenarios, we introduce a general measure of semantic consistency, and formulate multiple versions of this metric to evaluate the performance of various LLMs. Our proposal demonstrates significantly higher consistency and stronger correlation with human evaluations of output consistency than traditional metrics based on lexical consistency. Finally, we propose a novel prompting strategy, called Ask-to-Choose (A2C), to enhance semantic consistency. When evaluated for closed-book question answering based on answer variations from the TruthfulQA benchmark, A2C increases accuracy metrics for pretrained and finetuned LLMs by up to 47%, and semantic consistency metrics for instruction-tuned models by up to 7-fold.

研究の動機と目的

  • 単一トークン出力にとどまらない、LLM出力の意味的整合性を評価するための堅牢な評価手法の欠如に取り組む。
  • パラフレーズ化されたプロンプト間で意味的同等性を捉える一般化可能なメトリクスを構築し、実世界のNLG応用における信頼性を向上させる。
  • LLMにおいて正解率と整合性が相関していると仮定されがちであるが、その乖離を解明する。
  • 事実的正確性を損なわずに、意味的整合性と正解率の両方を向上させるプロンプト戦略を設計する。
  • 提案されたメトリクスと手法を人間の判断および既存の語彙ベースのメトリクスと比較して検証する。

提案手法

  • 文脈学習を用いたLLMベースのパイプラインを複数段階に分け、few-shotプロンプトを用いてパラフレーズ化された質問を生成し、短い答えを抽出する。
  • 補助的なLLMを用い、多様な意味的合意関数(例:含意、類義、BLEURT)を用いて、生成された答えの対比較的意味的同等性をスコア化する。
  • 集約された対比較的意味的同等性に基づく一般化された意味的整合性メトリクスを定式化し、多様なLLMアーキテクチャーやデコード戦略での評価を可能にする。
  • 意味的整合性と正解率の両方を向上させるために、選択肢を明示的に提示する形でモデルを誘導する「Ask-to-Choose(A2C)」プロンプト戦略を導入する。
  • 意味的整合性フレームワーク内で、パラフレーズ、含意、矛盾、語彙ベースのメトリクスといった複数の意味的合意関数を用い、メトリクスの頑健性と人間の好みとの整合性を評価する。
  • 1問あたり6回のLLMコールを用いた推論パイプラインを採用し、答え生成、短縮、意味的スコアリングの段階を経て、最終的な整合性スコアを算出する。

実験結果

リサーチクエスチョン

  • RQ1語彙的類似性を越えて、LLM出力の意味的整合性をどのようにより効果的に測定できるか?
  • RQ2意味的整合性は、出力類似性に関する人間の判断とどの程度相関するか?
  • RQ3プロンプト戦略により、事実的正確性を損なわずに、LLMの正解率と意味的整合性の両方を向上させられるか?
  • RQ4LLMにおいて正解率と整合性の間に乖離が生じている場合、それがアーキテクチャ的またはプロンプト介入によって是正可能か?
  • RQ5含意やパラフレーズなどの異なる意味的合意関数(例:含意、パラフレーズ)は、整合性の測定と人間の好みの整合性において、どのように比較されるか?

主な発見

  • 大規模なLLMは意味的整合性が高くなるが、同時に正解率がサイズに反比例する逆スケーリング効果を示すことがある。
  • 意味的整合性と正解率は独立した性質である。モデルは整合的だが不正確である場合や、正確だが整合的でない場合がある。
  • 提案された意味的整合性メトリクスは、BLEU や ROUGE などの従来の語彙ベースのメトリクスよりも、人間の判断と顕著に高い相関を示す。
  • Ask-to-Choose(A2C)プロンプト戦略により、閉形式QAにおける指令微調整モデルで、正解率が最大47%向上し、意味的整合性が最大7倍に高まる。
  • A2Cを適用した後、正確な答えの整合性スコアは高いか、向上し、モデル全体でPPメトリクスは0.87から0.88に上昇した。
  • 人間の判断と意味的整合性メトリクス(特に含意とパラフレーズ)の間の対比較的相関は強く保たれ、A2C適用後、エントロピー指標の相関がわずかに向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。