Skip to main content
QUICK REVIEW

[論文レビュー] All That's 'Human' Is Not Gold: Evaluating Human Evaluation of Generated Text

Elizabeth A. Clark, Tal August|arXiv (Cornell University)|Jun 30, 2021
Topic Modeling被引用数 16
ひとこと要約

本研究では、物語、ニュース記事、レシピの分野において、GPT3が生成した文章と人間が書いた文章を非専門の一般評価者たちがどれだけ正確に区別できるかを評価している。詳細な説明、アノテーション例、対比較の訓練を経ても、評価者の正答率は最大で55%にとどまり、これは偶然よりも顕著に高い水準に達しない。これは、現代の自然言語生成(NLG)モデルの評価において、訓練を受けていない人間の評価の限界を示している。

ABSTRACT

Human evaluations are typically considered the gold standard in natural language generation, but as models' fluency improves, how well can evaluators detect and judge machine-generated text? We run a study assessing non-experts' ability to distinguish between human- and machine-authored text (GPT2 and GPT3) in three domains (stories, news articles, and recipes). We find that, without training, evaluators distinguished between GPT3- and human-authored text at random chance level. We explore three approaches for quickly training evaluators to better identify GPT3-authored text (detailed instructions, annotated examples, and paired examples) and find that while evaluators' accuracy improved up to 55%, it did not significantly improve across the three domains. Given the inconsistent results across text domains and the often contradictory reasons evaluators gave for their judgments, we examine the role untrained human evaluations play in NLG evaluation and provide recommendations to NLG researchers for improving human evaluations of text generated from state-of-the-art models.

研究の動機と目的

  • 多様なドメインにおける人間とGPT3が生成した文章を、訓練を受けていない非専門の評価者たちがどれだけ正確に区別できるかを評価すること。
  • 詳細な説明、アノテーション例、対比較の訓練を経て、評価者の文章生成の検出能力が向上するかどうかを調査すること。
  • 生成された文章の「人間らしさ」を評価する際、評価者が主に注目するテクスト的特徴を分析すること。
  • 現代の自然言語生成(NLG)モデルの評価基準としての人間評価の信頼性を評価すること。
  • NLG研究における人間評価の実務改善に向けた実行可能な提言を提供すること。

提案手法

  • 物語、ニュース記事、レシピの3つのドメインから抽出した500件のテキストサンプルを対象に、非専門参加者を用いた人間評価実験を実施した。
  • 各テキストについて、「確かに人間が書いたもの」と「おそらく人間が書いたもの」、「おそらく機械が生成したもの」と「確かに機械が生成したもの」という4段階のスケールで評価を依頼した。
  • 3つの異なる訓練条件(詳細な説明、アノテーション例、人間・機械の対比例)を提供した。
  • 評価の根拠となる定性的な説明を収集し、評価者の推論と注目領域を分析した。
  • 評価者の判断と実際のテキスト生成元との相関を分析し、ドメインごとの正答率と一貫性を測定した。
  • 統計的分析を用いて、訓練方法が検出性能の向上に顕著に寄与したかどうかを評価した。

実験結果

リサーチクエスチョン

  • RQ1訓練を受けていない非専門の評価者たちは、複数のドメインにおいてGPT3が生成した文章と人間が書いた文章を信頼性を持って区別できるか?
  • RQ2詳細な説明、アノテーション例、対比較の訓練を提供することで、評価者の機械生成文の検出能力が顕著に向上するか?
  • RQ3評価者は、生成された文章の「人間らしさ」を評価する際、主にどのようなテクスト的特徴に注目しているか?
  • RQ4評価者の判断は、異なるテキストドメイン間で一貫しているか? 一貫性の欠如はどのような要因に起因しているか?
  • RQ5評価者たちは、最先端の言語モデル出力の質をどれほど低く評価しているのか?

主な発見

  • 訓練を受けていない評価者たちは、物語、ニュース記事、レシピの3つのドメインすべてにおいて、GPT3が生成した文章と人間が書いた文章をランダムな確率を超えて区別できなかった。
  • 詳細な説明、アノテーション例、対比較の訓練を経ても、評価者の正答率はわずかに向上したにとどまり、最大で55%にとどまった。
  • 評価者たちは、主に文法、スペル、スタイルといった表面的な特徴に注目しており、内容の質や事実の整合性にはあまり注目していなかった。
  • 判断はしばしば矛盾していた。同じテキスト的特徴が、人間の作成と機械の作成の両方を正当化するために使われており、高い不一致を示していた。
  • 評価者たちはGPT3が生成した文章の質を体系的に低く評価しており、高品質なモデル出力を「確かに人間が書いたもの」として評価するケースが多かった。
  • 本研究は、現在の人間評価の実務が、特に誤りが文法的ではなく内容的である場合の現代のNLGモデルの評価には不十分であることを明らかにした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。