Skip to main content
QUICK REVIEW

[論文レビュー] Scarecrow: A Framework for Scrutinizing Machine Text.

Yao Dou, Maxwell Forbes|arXiv (Cornell University)|Jul 2, 2021
Topic Modeling参考文献 34被引用数 15
ひとこと要約

Scarecrow は、ニューラルテキスト生成における意味的・物語的・話法的誤りを特定するための、クラウドソーシングによる構造的誤りアノテーションスキーマである。1.3k件の人的・機械的生成ニュースパラグラフにわたる13,000件のアノテーションを詳細に分析し、パrameter、トレーニングデータ、デコード技術に基づくGPTモデル間のパフォーマンス差を明らかにした。本研究ではデータセットとツールキットを公開した。

ABSTRACT

Modern neural text generation systems can produce remarkably fluent and grammatical texts. While earlier language models suffered from repetition and syntactic errors, the errors made by contemporary models are often semantic, narrative, or discourse failures. To facilitate research of these complex error types, we introduce a new structured, crowdsourced error annotation schema called Scarecrow. The error categories used in Scarecrow -- such as redundancy, commonsense errors, and incoherence -- were identified by combining expert analysis with several pilot rounds of ontology-free crowd annotation to arrive at a schema which covers the error phenomena found in real machine generated text. We use Scarecrow to collect 13k annotations of 1.3k human and machine generate paragraphs of English language news text, amounting to over 41k spans each labeled with its error category, severity, a natural language explanation, and antecedent span (where relevant). We collect annotations for text generated by state-of-the-art systems with varying known performance levels, from GPT-2 Small through the largest GPT-3. We isolate several factors for detailed analysis, including parameter count, training data, and decoding technique. Our results show both expected and surprising differences across these settings. These findings demonstrate the value of Scarecrow annotations in the assessment of current and future text generation systems. We release our complete annotation toolkit and dataset at this https URL.

研究の動機と目的

  • 機械生成テキストにおける複雑な意味的・話法的誤りを特定するための、構造的でクラウドソーシングされた誤りアノテーションスキーマの開発。
  • 現代のニューラルテキスト生成システムにおける文法的誤りから意味的誤りへのシフトに対処すること。
  • GPT-2 Small および GPT-3 を含む多様なテキスト生成モデルを対象に、13,000件の誤りアノテーションを収集・分析すること。
  • モデルパラメータ、トレーニングデータ、デコード戦略が誤りパターンに与える影響を分離・評価すること。
  • 今後のテキスト生成評価研究を支援するため、包括的なアノテーションツールキットとデータセットを公開すること。

提案手法

  • 実世界の機械生成テキストに基づき、オントロジーフリーのクラウドアノテーションを繰り返しパイロット実験を経て、関連する誤りカテゴリを同定することで、Scarecrow を開発した。
  • 冗長性、常識違反、一貫性の欠如などの誤りカテゴリを、実際の機械生成テキストに基づいて定義した。
  • 人的・機械的生成英語ニューステキストの1.3kパラグラフにわたって、合計13,000件のアノテーションを収集した。
  • 各アノテーションには、誤りカテゴリ、深刻度、自然言語による説明、該当する前件語節が含まれる。
  • GPT-2 Small から最大の GPT-3 に至るまでの最先端モデルが生成したテキストに、このスキーマを適用した。
  • パrameter数、トレーニングデータ、デコード技術に基づくモデルバリアント間で比較分析を実施した。

実験結果

リサーチクエスチョン

  • RQ1異なるニューラルテキスト生成モデル間で、意味的および話法的誤りはどのように変動するか?
  • RQ2モデルパラメータ、トレーニングデータ、デコード戦略は、誤り頻度およびタイプにどのような影響を及えるか?
  • RQ3Scarecrowアノテーションスキーマは、機械生成テキストにおける微細な誤り現象を的確に捉えられるか?
  • RQ4人間が書いた文章とモデルが生成した文章の間で、誤りパターンに体系的な差異があるか?
  • RQ5より大きなモデルは、意味的および話法的誤りの数や種類を、より少なくまたは異なる形で示すか?

主な発見

  • Scarecrow は、機械生成テキストにおける冗長性、常識違反、一貫性の欠如を含む、幅広い意味的および話法的誤りを的確に捉えることに成功した。
  • GPT-3 などの大規模モデルは、GPT-2 Small などの小規模モデルと比較して、全体的な誤り率が低かったが、誤りの種類は顕著に異なることが判明した。
  • デコード技術は誤りパターンに顕著な影響を及ぼし、温度や top-p サンプリングが一貫性および事実の整合性に影響を与えた。
  • トレーニングデータの構成は、特に常識的整合性および物語的整合性の観点で、誤りプロファイルに測定可能な影響を及えた。
  • アノテーションプロセスを通じて、期待される傾向と予期せぬ変動(特に高性能モデルに予期しない誤りクラスタが出現)の両方が明らかになった。
  • 公開されたデータセットとツールキットは、今後のテキスト生成システムのベンチマークと改善の基盤を強固に提供している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。