Skip to main content
QUICK REVIEW

[論文レビュー] Repairing the Cracked Foundation: A Survey of Obstacles in Evaluation Practices for Generated Text

Sebastian Gehrmann, Elizabeth A. Clark|arXiv (Cornell University)|Feb 14, 2022
Topic Modeling被引用数 8
ひとこと要約

この論文は、自然言語生成(NLG)評価における長年の欠陥、すなわち偏りのあるデータセット、信頼性の低い自動メトリクス、一貫性の欠如した人間による評価について調査している。評価レポートの提案により、多様なメトリクスと共有データを用いてモデルの限界を強調し、最近のNLG論文のうちたった27%しか主要な推奨事項に従っていないことが明らかになった。特に、データセットの文書化と再現可能性に大きなギャップが存在する。

ABSTRACT

Evaluation practices in natural language generation (NLG) have many known flaws, but improved evaluation approaches are rarely widely adopted. This issue has become more urgent, since neural NLG models have improved to the point where they can often no longer be distinguished based on the surface-level features that older metrics rely on. This paper surveys the issues with human and automatic model evaluations and with commonly used datasets in NLG that have been pointed out over the past 20 years. We summarize, categorize, and discuss how researchers have been addressing these issues and what their findings mean for the current state of model evaluations. Building on those insights, we lay out a long-term vision for NLG evaluation and propose concrete steps for researchers to improve their evaluation processes. Finally, we analyze 66 NLG papers from recent NLP conferences in how well they already follow these suggestions and identify which areas require more drastic changes to the status quo.

研究の動機と目的

  • 生成テキストの自動的および人間による評価におけるシステム的欠陥に対処し、モデルの能力を正確に評価するのを妨げる要因を解消すること。
  • 多様性の欠如、英語バイアス、文書化の不備といった、NLGデータセットに根ざした継続的な問題を特定し、評価結果の歪みを明らかにすること。
  • 出版のインcentive(高いパフォーマンス)と、モデルの限界を厳密かつ透明に評価する必要性との間の不整合を強調すること。
  • 複数のメトリクスと共有データを用いてモデルの欠陥を文書化する標準化されたフレームワークとしての評価レポートを提言すること。
  • コミュニティ全体での評価ベストプラクティスの採用を呼びかけ、モデルのパフォーマンスと実世界での信頼性の間のギャップを埋めること。

提案手法

  • NLG評価に関する過去20年間の批判をサーベイし、自動メトリクス、人間評価、データセット設計の分野における問題をカテゴライズする。
  • ACL、EMNLP、INLGに掲載された66篇の最近のNLG論文を分析し、提案された評価ベストプラクティスへの適合度を評価する。
  • モデルの限界を因果的フレーミングで強調する評価レポートを提言し、自動メトリクス、人間評価、データ共有を統合する。
  • 古くなったメトリクスの廃止を提唱し、品質と最適化を一致させるために、BLEURTのような最新でより頑健なメトリクスの採用を促進する。
  • 査読プロセスの見直しを呼びかけ、評価レポートの基準を強制し、モデル開発における責任を高めること。
  • ミッチェルら(2019)の例のようなモデル文書化と形式的評価プロセスの知見を統合し、評価の厳密さを強化する。

実験結果

リサーチクエスチョン

  • RQ1NLGにおける生成テキストの現在の自動的および人間による評価手法の核心的な欠陥は何か?
  • RQ2一般的に使用されるNLGデータセットにおけるバイアスや設計の欠陥は、モデル評価の信頼性をどのように損なうか?
  • RQ3それらの改善策が、その価値が強く証明されているにもかかわらず、なぜほとんど採用されないのか?
  • RQ4最近のNLG論文は、評価レポート、データセット文書化、メトリクスの多様性の観点から、どの程度ベストプラクティスを遵守しているか?
  • RQ5モデルの限界に焦点を当てた評価レポートは、モデルの透明性と長期的な評価の持続可能性をどの程度向上させ得るか?

主な発見

  • 分析対象の66篇の最近のNLG論文のうち、わずか27%しか主要な評価推奨事項に従っておらず、ベストプラクティスの未採用が広範に見られる。
  • 84%の論文が複数のデータセットで結果を報告しているが、そのうちたった1件のみがデータセット文書化に貢献しており、今後の研究者が欠陥を再発見する羽目になっている。
  • 多くの論文が、モデルがしばしば事実を捏造したり、過学習を起こしたり、単純な推論タスクで失敗したりするという証拠があるにもかかわらず、その限界を報告していない。
  • 大多数の論文が、コンテンツ品質や事実の整合性をうまく捉えられない表面的メトリクス(BLEU や ROUGE)に依存している。
  • 標準メトリクスに基づく強化学習最適化は、しばしばモデル品質を向上させないが、BLEURTのような新しい学習済みメトリクスは有望な兆しを示している。
  • 強いインcentiveの不整合が存在する:高パフォーマンスの数値を発表することが、透明性の高い限界中心の評価報告よりも優先されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。