[論文レビュー] TIGERScore: Towards Building Explainable Metric for All Text Generation Tasks
TIGERScore は、42,000件のサンプルから構成される指令微調整データセット(MetricInstruct)を用いてファインチューニングされた LLaMA-2 を活用し、エラー解析を生成し、誤りを特定してペナルティスコアを割り当てる、参照なし、指令誘導型、説明可能なテキスト生成用メトリックである。TIGERScore は、7つのテキスト生成タスクにおいて、人間の評価と優れた相関関係を示し、参照なしおよび参照ありメトリックをすべて上回る最先端の性能を達成しており、70.8% の人間評価による説明が正確である。
We present TIGERScore, a extbf{T}rained metric that follows extbf{I}nstruction extbf{G}uidance to perform extbf{E}xplainable, and extbf{R}eference-free evaluation over a wide spectrum of text generation tasks. Different from other automatic evaluation methods that only provide arcane scores, TIGERScore is guided by natural language instruction to provide error analysis to pinpoint the mistakes in the generated text. Our metric is based on LLaMA-2, trained on our meticulously curated instruction-tuning dataset MetricInstruct which covers 6 text generation tasks and 23 text generation datasets. The dataset consists of 42K quadruple in the form of (instruction, input, system output $ ightarrow$ error analysis). We collected the `system outputs' through from a large variety of models to cover different types of errors. To quantitatively assess our metric, we evaluate its correlation with human ratings on 5 held-in datasets, 2 held-out datasets and show that TIGERScore can achieve the open-source SoTA correlation with human ratings across these datasets and almost approaches GPT-4 evaluator. As a reference-free metric, its correlation can even surpass the best existing reference-based metrics. To further qualitatively assess the rationale generated by our metric, we conduct human evaluation on the generated explanations and found that the explanations are 70.8\% accurate. Through these experimental results, we believe TIGERScore demonstrates the possibility of building universal explainable metrics to evaluate any text generation task. All the resourced are released in our project website: \url{https://tiger-ai-lab.github.io/TIGERScore/}.
研究の動機と目的
- 既存の自動評価メトリックがゴールドリファレンスに依存する、タスク間で一般化できない、またはエラーの原因を特定できないという限界を是正すること。
- 多様なテキスト生成タスクに適用可能な、普遍的で説明可能かつ参照なしの評価メトリックを開発すること。
- 誤りの特定、その説明、ペナルティスコアの割り当てを通じて、モデル評価の信頼性と解釈可能性を向上させること。
- リファレンストキストを必要とせず、複数のベンチマークで人間の評価と高い相関を達成すること。
提案手法
- 入力出力ペア(指令、入力、システム出力、エラー解析)を含む、42,000件のサンプルから構成される洗練された指令微調整データセット(MetricInstruct)を用いて、LLaMA-2 をファインチューニングする。
- 23個のテキスト生成データセットおよび6つのタスクをカバーする、50以上のモデルのシステム出力を収集し、多様なエラー種別を網羅する。
- GPT-4 を用いて高品質なエラー解析を生成・フィルタリングし、事実の正確性とエラーの局所化を保証する。
- 評価パイプラインを設計し、個々のペナルティスコアの合計である最終ペナルティスコアに加え、各エラーの自然言語による説明を出力する。
- モデルが誤りを特定し、その性質を説明し、修正案を提示するエラー解析を生成するように訓練する。
- ホールドインおよびホールドアウトのデータセット上で、人間の評価との Kendall’s、Pearson’s、Spearman’s 相関を用いてメトリックを評価する。

実験結果
リサーチクエスチョン
- RQ1参照なしメトリックは、多様なテキスト生成タスクにおいて、人間の評価と最先端の相関関係を達成できるか?
- RQ2指令誘導型のLLMは、正確で局所化され、実行可能であるエラー説明をモデル出力に対して生成できるか?
- RQ3トレーニングデータの質と多様性が、説明可能な評価メトリックの一般化性能に与える影響は何か?
- RQ4説明可能なメトリックは、既存の参照ありおよび参照なしベースラインを、相関性と解釈可能性の両面で上回るか?
- RQ51つの統一されたメトリックは、タスク固有の適応なしに、複数のテキスト生成タスクを効果的に評価できるか?
主な発見
- TIGERScore は、7つの主要なテキスト生成タスクにおいて、人間の評価との最先端の Kendall’s 相関を達成しており、最良の参照なしメトリック(GPTScore)を15%、最良の参照ありメトリック(COMET-22)を8%上回っている。
- ホールドアウトデータセットでは、TIGERScore は前例のない一般化性能を示し、最良の参照なしメトリックに対して13ポイントの向上、最良の参照ありメトリックに対して6ポイントのリードを記録した平均 Kendall’s 相関で顕著な優位性を示した。
- 人間評価により、TIGERScore が生成するエラー説明の70.8% が正確で信頼できることが確認され、その解釈可能性と信頼性が裏付けられた。
- TIGERScore の成功は、MetricInstruct データセットの3つの主要要因に起因する:タスクおよびデータセットの高い多様性、エラー種別の包括的カバレッジ、高品質な洗練されたアノテーション。
- TIGERScore は、大多数のタスクで GPT-4 ゼロショットを上回る平均相関を達成しており、優れた一般化性能とロバストネスを示している。
- 要約、翻訳、対話からテキストへの変換、推論など、多様なタスクで強力な性能を発揮しており、その普遍性が確認された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。