Skip to main content
QUICK REVIEW

[論文レビュー] Artificial Intelligence versus Maya Angelou: Experimental evidence that people cannot differentiate AI-generated from human-written poetry

Nils Köbis, Luca Mossink|arXiv (Cornell University)|May 20, 2020
Topic Modeling被引用数 4
ひとこと要約

本研究では、GPT-2を用いて生成されたAI詩と人間が書いた詩を人々が区別できるかを調査している。830名の参加者を対象とした制御された実験において、最良の出力を選んだ場合(人間が関与する状況)、人々はAIが生成した詩を信頼性を持って検出できなかったが、ランダムな出力を用いた場合(人間が関与しない状況)には検出できた。これは、高度な人間らしいテキスト生成の能力を示している。参加者たちは、詩の出どころが明示されていようがいまいが、AI詩に対してわずかだが一貫した嫌悪感を示した。

ABSTRACT

The release of openly available, robust natural language generation algorithms (NLG) has spurred much public attention and debate. One reason lies in the algorithms' purported ability to generate human-like text across various domains. Empirical evidence using incentivized tasks to assess whether people (a) can distinguish and (b) prefer algorithm-generated versus human-written text is lacking. We conducted two experiments assessing behavioral reactions to the state-of-the-art Natural Language Generation algorithm GPT-2 (Ntotal = 830). Using the identical starting lines of human poems, GPT-2 produced samples of poems. From these samples, either a random poem was chosen (Human-out-of-the-loop) or the best one was selected (Human-in-the-loop) and in turn matched with a human-written poem. In a new incentivized version of the Turing Test, participants failed to reliably detect the algorithmically-generated poems in the Human-in-the-loop treatment, yet succeeded in the Human-out-of-the-loop treatment. Further, people reveal a slight aversion to algorithm-generated poetry, independent on whether participants were informed about the algorithmic origin of the poem (Transparency) or not (Opacity). We discuss what these results convey about the performance of NLG algorithms to produce human-like text and propose methodologies to study such learning algorithms in human-agent experimental settings.

研究の動機と目的

  • 人々がAIが生成した詩と人間が書いた詩を信頼性を持って区別できるかを評価すること。
  • 制御された実験的状況において、AIが生成した詩と人間が書いた詩の好みを調査すること。
  • 出典の透明性(生成元が分かっているかどうか)が、AI生成テキストの認識および好みに与える影響を評価すること。
  • GPT-2のような最先端のNLGモデルが、人間らしい詩的テキストを生成する能力をテストすること。
  • 生成AIを含む実験的状況における人間とエージェントの相互作用を研究するための方法論を開発すること。

提案手法

  • 830名の参加者を対象としたインcentivized(報酬付き)実験を2回実施し、人間の詩から同じ開始文を用いた。
  • GPT-2を用いて、同じ開始文から詩のサンプルを生成し、最良の出力(人間が関与する状況)またはランダムな出力(人間が関与しない状況)を選択した。
  • 比較のため、品質が類似した人間が書いた詩とAIが生成した詩をマッチングした。
  • 検出精度と好みを評価するため、新規の報酬付きチューリングテストの変種を実装した。
  • 偏りを評価するために、出典が明示されている(透明性)と明示されていない(不透明性)の条件を変化させた。
  • 制御された二重盲検実験デザインを用いて、検出精度と好みに関する行動反応を収集した。

実験結果

リサーチクエスチョン

  • RQ1GPT-2の最良の出力が使われた場合、参加者がAIが生成した詩を信頼性を持って検出できるか?
  • RQ2出力の選択方法(最良 vs. ランダム出力)が、参加者のAI詩と人間詩の区別能力に影響を与えるか?
  • RQ3参加者は人間が書いた詩かAIが生成した詩のどちらを好むか。また、その好みは生成元の透明性に依存するか?
  • RQ4詩のアルゴリズム的生成元についての透明性が、詩の品質の認識および評価にどのように影響するか?
  • RQ5GPT-2のような最先端のNLGモデルが、詩といった創造的分野において、人間の文章と区別がつかないほどにテキストを生成できるか、その程度はどの程度か?

主な発見

  • 人間が関与する状況(最良のGPT-2出力が選択された条件)では、参加者がAIが生成した詩を信頼性を持って検出できなかった。これは、非常に人間らしいテキスト生成の能力を示している。
  • 人間が関与しない状況(ランダムなGPT-2出力が使用された条件)では、参加者がAIが生成した詩を検出できた。これは、出力品質のばらつきが検出可能性に影響を与える可能性を示唆している。
  • 参加者たちは、生成元が明示されていようがいまいが、AI詩に対してわずかだが一貫した嫌悪感を示した。
  • 本研究は、GPT-2のような最先端のNLGモデルが、最適な条件下で人間の詩とほとんど区別がつかない詩を生成できることを実証的根拠で示している。
  • 結果として、現在のNLGシステムが創造的分野において、人間の知覚テストを通過するようなテキストを生成できることを示しており、芸術的表現における人間の独自性に関する仮定に挑戦している。
  • 本研究は、生成AIを含む実験的状況における人間とエージェントの相互作用を研究するための、新たな方法論的枠組みの必要性を浮き彫りにしている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。