Skip to main content
QUICK REVIEW

[論文レビュー] AlignScore: Evaluating Factual Consistency with a Unified Alignment Function

Yuheng Zha, Yichi Yang|arXiv (Cornell University)|May 26, 2023
Topic Modeling被引用数 7
ひとこと要約

本稿では、7つの自然言語処理(NLP)タスクから得た470万件の多様な例を用いて訓練された汎用的テキスト対テキストアライメント関数を活用する統合的妥当性整合性メトリクス、AlignScoreを紹介する。RoBERTaモデル(125M〜355Mパラメータ)を微調整することで、22のベンチマーク(うち19件はゼロショットデータセット)において、GPT-4に基づくメトリクスを凌駕または同等にし、顕著に小型であるにもかかわらず最先端の性能を達成する。

ABSTRACT

Many text generation applications require the generated text to be factually consistent with input information. Automatic evaluation of factual consistency is challenging. Previous work has developed various metrics that often depend on specific functions, such as natural language inference (NLI) or question answering (QA), trained on limited data. Those metrics thus can hardly assess diverse factual inconsistencies (e.g., contradictions, hallucinations) that occur in varying inputs/outputs (e.g., sentences, documents) from different tasks. In this paper, we propose AlignScore, a new holistic metric that applies to a variety of factual inconsistency scenarios as above. AlignScore is based on a general function of information alignment between two arbitrary text pieces. Crucially, we develop a unified training framework of the alignment function by integrating a large diversity of data sources, resulting in 4.7M training examples from 7 well-established tasks (NLI, QA, paraphrasing, fact verification, information retrieval, semantic similarity, and summarization). We conduct extensive experiments on large-scale benchmarks including 22 evaluation datasets, where 19 of the datasets were never seen in the alignment training. AlignScore achieves substantial improvement over a wide range of previous metrics. Moreover, AlignScore (355M parameters) matches or even outperforms metrics based on ChatGPT and GPT-4 that are orders of magnitude larger.

研究の動機と目的

  • 自然言語処理(NLP)タスクに特化した関数(例:NLI や QA)に依存する既存の妥当性整合性メトリクスの一般化能力の低さを是正すること。
  • さまざまなテキスト長さやドメインにわたる多様な妥当性の不整合を評価できる包括的かつ統合的なアライメント関数を構築すること。
  • 7つの確立されたNLPタスクをカバーする広範かつ多様なデータ分布を用いて、汎用的アライメントモデルを訓練すること。
  • タスク固有の微調整を必要とせず、未学習の評価シナリオに一般化できる、軽量かつ高効果なメトリクスを構築すること。
  • より小さな統合モデルが、GPT-4のような大規模モデルを上回る妥当性整合性評価性能を示せることを実証すること。

提案手法

  • NLI、QA、並び替え、事実検証、情報検索、意味的類似性、要約の7つのタスクから得た470万件の例を用いて、統合的テキスト対テキストアライメント関数を訓練する。
  • 15のデータセットを統合的アライメント学習目的に再形式化・統合し、モデルが多様なテキストペア間の一般化された情報アライメントを学習できるようにする。
  • コンテキスト分割戦略を採用:長文コンテキストを粗い粒度のチャンクに、主張(claim)を細かい粒度の文に分割することで、長文テキストのアライメント精度を向上させる。
  • コンテキストチャンクと主張文間のペアごとのアライメントスコアを統合し、最終的な妥当性整合性スコアを算出する。
  • 対照的学習目的を用いて、RoBERTa-base(125Mパラメータ)およびRoBERTa-large(355Mパラメータ)モデルをアライメント関数のために微調整する。
  • SummaC や TRUE を含む22のスケーリングされたベンチマークで最終的な AlignScore メトリクスを評価し、19のデータセットは訓練時にホールドアウト(ゼロショット評価)する。

実験結果

リサーチクエスチョン

  • RQ1多様なNLPタスクで訓練された統合的アライメント関数は、複数のタスクやテキストタイプにわたる妥当性整合性評価に一般化可能か?
  • RQ2355Mパラメータの軽量モデルは、GPT-4のような大規模言語モデルと比較して、妥当性整合性評価でどのように性能を発揮するか?
  • RQ3コンテキスト分割戦略は、長文テキスト生成タスクでの性能向上にどの程度寄与するか?
  • RQ4統合的なトレーニングフレームワークは、タスク固有のメトリクスと比較して、より優れたゼロショット一般化性能をもたらすか?
  • RQ51つのアライメント関数は、矛盾や幻覚といった多様な妥当性の不整合を効果的に捉えられるか?

主な発見

  • AlignScoreは、22の評価データセットすべてで以前のメトリクスを顕著に上回り、訓練時に使われなかった19件のデータセットに対しても同様に優れた性能を示す。
  • 355MパラメータのAlignScoreモデルは、GPT-4ベースのメトリクスと同等またはそれを上回る性能を示しており、サイズが桁違いに小さいにもかかわらず顕著である。
  • AlignScoreは、訓練時に使われなかった19/22のベンチマークで優れたゼロショット一般化性能を示しており、顕著である。
  • アブレーションスタディにより、コンテキスト分割戦略が性能向上に顕著に寄与することが確認され、特に長文テキスト処理で顕著である。
  • 多様なデータソースを統合したトレーニングフレームワークは、タスク固有の代替手法よりも、より強固で一般化可能なアライメント関数を生み出す。
  • モデルの性能は、要約、対話、事実検証など多様なタスクで一貫しており、その包括的設計が裏付けられている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。