[論文レビュー] Experimental Narratives: A Comparison of Human Crowdsourced Storytelling and AI Storytelling
本稿は、同一の架空のプロンプトを用いて、250名のクラウドワーカーによる人間の物語作りとGPT-3.5およびGPT-4が生成した物語(n=80)を比較する行動的・計算的枠組みを提示する。その結果、AIの物語はジェンダーおよび性的指向の表現においてより進歩的である一方で、人間が書いた物語と比べて、想像力豊かな修辞的表現や物語構成の複雑さに欠けていることが明らかになったが、明確さと一貫性については同等であった。
The paper proposes a framework that combines behavioral and computational experiments employing fictional prompts as a novel tool for investigating cultural artifacts and social biases in storytelling both by humans and generative AI. The study analyzes 250 stories authored by crowdworkers in June 2019 and 80 stories generated by GPT-3.5 and GPT-4 in March 2023 by merging methods from narratology and inferential statistics. Both crowdworkers and large language models responded to identical prompts about creating and falling in love with an artificial human. The proposed experimental paradigm allows a direct and controlled comparison between human and LLM-generated storytelling. Responses to the Pygmalionesque prompts confirm the pervasive presence of the Pygmalion myth in the collective imaginary of both humans and large language models. All solicited narratives present a scientific or technological pursuit. The analysis reveals that narratives from GPT-3.5 and particularly GPT-4 are more progressive in terms of gender roles and sexuality than those written by humans. While AI narratives with default settings and no additional prompting can occasionally provide innovative plot twists, they offer less imaginative scenarios and rhetoric than human-authored texts. The proposed framework argues that fiction can be used as a window into human and AI-based collective imaginary and social dimensions.
研究の動機と目的
- 架空のプロンプトを用いて、人間とAIが生成する物語における文化的想像力と社会的バイアスを研究するための新規な実験的枠組みの構築。
- 人間が人工的に作り出した人間をテーマとするピグマリオン神話が、人間と大規模言語モデル(LLM)が生成する物語の内容にどのように影響を与えるかの調査。
- 特にジェンダーとレースに関するインプリシットな社会的バイアス、すなわちキャラクターの描写や役割割り当てにおけるバイアスの評価。
- GPT-3.5およびGPT-4が人間の作家と比較して、物語の革新性、修辞的スタイル、プロットの複雑さという観点から、創造的潜在能力を評価すること。
- 架空のプロンプトを、人工的人文学分野における実証的・比較的研究所のツールとしての有効性を確立し、AI設計および人間とAIの相互作用に影響を与えること。
提案手法
- 250名のAmazon Mechanical TurkのクラウドワーカーとGPT-3.5およびGPT-4が生成した80編の物語に、人工人間の創造と恋に落ちることをテーマにした同一の架空のプロンプトを適用した制御された実験を実施。
- 物語的分析(プロット、語り口、設定)と推論的統計分析を組み合わせた混合研究手法を用い、コーパス間の物語的特徴を比較。
- ジェンダー、レース、性的指向の表現を測定する定量的分析を実施し、役割の分布と関係性のダイナミクスに焦点を当てる。
- 修辞的スタイル、想像的範囲、物語的革新性(プロットの意外な展開や描写言語を含む)を評価するための定性的比較分析を実施。
- 架空の物語を文化的なアーカイブとして扱い、人間とLLMが生成したコンテンツのクロスアナリシスを可能にする。
- ピグマリオン神話を文化的なレンズとして用い、人間とAIの物語作りにおける継続的な物語的トロープとその進化を研究。

実験結果
リサーチクエスチョン
- RQ1人間とLLMが生成する物語は、物語構造とテーマ的コンテンツにおいて、どれほどピグマリオン神話の影響を反映しているか?
- RQ2ピグマリオントロープの文脈において、人間が書いた物語とAIが生成した物語の間で、ジェンダー役割や性的指向の表現はどのように異なるか?
- RQ3GPT-3.5およびGPT-4の物語は、人間が書いた物語と比較して、物語的想像力、修辞的スタイル、プロットの革新性の観点で、どのような点で異なるか?
- RQ4LLMが生成する物語は、キャラクターの描写や役割割り当てにおいて、レースおよびジェンダー関連の社会的バイアスをどれほど反映または強化しているか?
- RQ5架空のプロンプトは、人間と人工知能の両方の物語作りにおける文化的想像力と社会的バイアスを研究するための信頼性がありスケーラブルなツールとして機能するか?
主な発見
- 人間とAIが生成した330編の物語すべてが、人工人間の科学的・技術的創造をテーマとしており、現代の文化的想像力にピグマリオン神話が広く根付いていることを確認した。
- GPT-4は、GPT-3.5と比較してやや劣るが、人間が書いた物語よりもジェンダー役割や同性カップルの描写がより進歩的であり、特に女性キャラクターにステレオタイプでない役割を割り当てている。
- 表現の進歩性にかかわらず、AIの物語は人間が書いた物語と比べて、設定、シナリオ、修辞的スタイルの面で常に想像力に欠けており、人間の物語はより色あざやかで遊び心のある言語を用いていた。
- GPTが生成する物語は、単純化された道徳的解決策や、たとえば「神を演じる」や「幸福な幻想」といったレトリックに頻繁に依存しており、物語的スキルセットが限定的であることが示された。
- AIの物語は明確さと理解可能性において人間の物語と同等またはわずかに上回っていたが、人間の物語に見られるような物語の多様性や創造的リスクの取り組みには欠けていた。
- 本研究では、AIが生成する物語は、世代を超えて一貫性があり、識別可能ではあるが、物語の一般化の観点では平均的な人間作家と同等であり、特徴的な物語的革新性に欠けていることが判明した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。