Skip to main content
QUICK REVIEW

[論文レビュー] Pron vs Prompt: Can Large Language Models already Challenge a World-Class Fiction Author at Creative Text Writing?

Guillermo Marco, Julio A. Gonzalo|arXiv (Cornell University)|Jul 1, 2024
Digital Humanities and ScholarshipArts and Humanities被引用数 3
ひとこと要約

本研究では、GPT-4と世界的な評価を受ける小説家パトリシオ・プロンの間で、自発的に生成されたおよび相手が提供したタイトルに基づく60の短編小説の要約を用いて、創造的作文能力を比較評価する、制御された対称的デュエルを実施した。GPT-4の滑らかさと一貫性は認められたが、専門家は常に人間が執筆した物語がより独創的で、感情的共感性が強く、創造的価値が高いと評価した。これは、大規模言語モデル(LLM)が、深いつながりや独自性に基づくのではなく、確率的パターン照合に依存しているため、熟練した人間の創造性にまだ到達していないことを示している。

ABSTRACT

It has become routine to report research results where Large Language Models (LLMs) outperform average humans in a wide range of language-related tasks, and creative text writing is no exception. It seems natural, then, to raise the bid: Are LLMs ready to compete in creative writing skills with a top (rather than average) novelist? To provide an initial answer for this question, we have carried out a contest between Patricio Pron (an awarded novelist, considered one of the best of his generation) and GPT-4 (one of the top performing LLMs), in the spirit of AI-human duels such as DeepBlue vs Kasparov and AlphaGo vs Lee Sidol. We asked Pron and GPT-4 to provide thirty titles each, and then to write short stories for both their titles and their opponent's. Then, we prepared an evaluation rubric inspired by Boden's definition of creativity, and we collected 5,400 manual assessments provided by literature critics and scholars. The results of our experimentation indicate that LLMs are still far from challenging a top human creative writer, and that reaching such level of autonomous creative writing skills probably cannot be reached simply with larger language models.

研究の動機と目的

  • 最先端のLLM、GPT-4が自律的かつ制約のないタスクにおいて、世界的な小説家と同等の創造的作文の質を達成できるかどうかを、実証的に評価すること。
  • プロンプトの出典(自発的生成 vs. 相手のタイトル)が、人間およびAI作家の創造的出力に与える影響を調査すること。
  • LLMが創造的作文において識別可能なスタイル的特徴を示すかどうか、および専門家がAI生成文書と人間が執筆した文書を信頼性高く区別できるかどうかを評価すること。
  • 特に英語とスペイン語の出力における多言語的パフォーマンス格差が存在するかどうかを調査すること。
  • 専門家による評価を通じて、ボーデンの創造性フレームワーク(新規性、驚き、価値)がAI生成の創造的テキスト評価に実際に適用可能かどうかを検証すること。

提案手法

  • 対称的なライティングコンテストを実施:パトリシオ・プロンとGPT-4の両方がそれぞれ30のオリジナルタイトルを生成し、合計60の短編小説の要約(自身のタイトル30件、相手のタイトル30件)を執筆した。
  • マーガレット・ボーデンの創造性フレームワークに基づいた独自の評価基準を採用。新規性、驚き、価値に焦点を当て、文学評論家や学術研究者による5,400件の手動評価を実施。
  • ブラインド評価を実施:評価者は文章の著者を知らず、各テキストが人間が書いたものかAIが生成したものかを特定するように指示された。
  • GPT-4の英語とスペイン語のパフォーマンスを比較し、スペイン語の出力はバイリンガルの専門家によって評価された。
  • プロンプトの一貫性を厳密に維持:GPT-4に対して微調整やスタイル制約は一切適用せず、同一の条件下で自律的生成を保証した。
  • 評価の進行に伴い、専門家がAI生成テキストを識別する能力の向上を追跡するため、著者判別の正確性の変化を収集した。

実験結果

リサーチクエスチョン

  • RQ1RQ1: 現在の生成AIは、創造的作文タスクにおいて、最高水準の人間作家のスキルに匹敵できるか?
  • RQ2RQ2: プロンプト(特に相手のタイトル)が生成テキストの創造性に果たす役割は何か、特にその影響は?
  • RQ3RQ3: LLMは英語以外の言語、例えばスペイン語においても創造的作文で劣るのか?
  • RQ4RQ4: 制約なしに創造的テキストを生成する際、文学専門家がGPT-4のスタイルを識別できるか?
  • RQ5RQ5: AI生成テキストの文脈において、ボーデンのフレームワークを用いて創造性を効果的に測定できるか?

主な発見

  • GPT-4の出力は、人間が執筆したテキストよりも常に滑らかで一貫性があると評価されたが、専門家による評価では、独創性、感情的深さ、および認識される価値の面で顕著に低い水準にとどまった。
  • 人間が執筆した物語は、驚きや新規性が強く、専門家評価の68%がGPT-4の出力よりも高い創造性スコアを付与した。
  • 専門家はGPT-4が生成したテキストを平均72%の正確度で特定できた。評価が進むにつれてこの正確度はわずかに向上し、識別可能なスタイル的パターンが存在することが示唆された。
  • GPT-4はスペイン語のパフォーマンスが英語より悪く、平均創造性スコアが14%低下した。これは、リソース豊富な言語でもパフォーマンス格差が存在することを示している。
  • 高い滑らかさにもかかわらず、GPT-4の出力は、意図的または真正な独創的思考に基づくのではなく、確率的パターン照合に依存していると認識された。
  • 一貫性と創造性の間には強い相関関係が認められず、AI生成テキストにおいては、滑らかさが高いからといって創造的価値が高いとは限らないことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。