Skip to main content
QUICK REVIEW

[논문 리뷰] Experimental Narratives: A Comparison of Human Crowdsourced Storytelling and AI Storytelling

Nina Begus|arXiv (Cornell University)|2023. 10. 19.
Computational and Text Analysis Methods인용 수 4
한 줄 요약

이 논문은 동일한 가상 프롬프트를 사용하여 인간의 커뮤니티 기반 스토리텔링(n=250)과 GPT-3.5 및 GPT-4가 생성한 스토리텔링(n=80)을 비교하는 행동적이고 계산적 프레임워크를 제시한다. 분석 결과, AI 스토리는 성별 및 성적 지향 표현 측면에서 더 진보적인 경향을 보였지만, 인간이 작성한 스토리에 비해 상상력 있는 수사적 기법과 시나리오 복잡성 측면에서 떨어지며, 명료성과 일관성은 유사한 수준을 유지한다.

ABSTRACT

The paper proposes a framework that combines behavioral and computational experiments employing fictional prompts as a novel tool for investigating cultural artifacts and social biases in storytelling both by humans and generative AI. The study analyzes 250 stories authored by crowdworkers in June 2019 and 80 stories generated by GPT-3.5 and GPT-4 in March 2023 by merging methods from narratology and inferential statistics. Both crowdworkers and large language models responded to identical prompts about creating and falling in love with an artificial human. The proposed experimental paradigm allows a direct and controlled comparison between human and LLM-generated storytelling. Responses to the Pygmalionesque prompts confirm the pervasive presence of the Pygmalion myth in the collective imaginary of both humans and large language models. All solicited narratives present a scientific or technological pursuit. The analysis reveals that narratives from GPT-3.5 and particularly GPT-4 are more progressive in terms of gender roles and sexuality than those written by humans. While AI narratives with default settings and no additional prompting can occasionally provide innovative plot twists, they offer less imaginative scenarios and rhetoric than human-authored texts. The proposed framework argues that fiction can be used as a window into human and AI-based collective imaginary and social dimensions.

연구 동기 및 목표

  • 가상 프롬프트를 활용하여 인간과 AI가 생성한 스토리텔링에서 문화적 상상력과 사회적 편향을 연구하기 위한 새로운 실험적 프레임워크를 개발한다.
  • 인간이 인공 인류를 창조하는 데 중심을 두고 있는 Pygmalion 신화가 인간과 LLM이 생성한 스토리텔링의 서사 내용에 어떻게 영향을 미치는지 조사한다.
  • 특히 성별과 인종에 관한 암묵적 사회적 편향, 즉 인간과 AI가 생성한 스토리텔링에서의 성별 및 인종 표현을 평가한다.
  • GPT-3.5와 GPT-4가 인간 작가에 비해 서사 혁신, 수사적 스타일, 플롯 복잡성 측면에서 얼마나 창의적 잠재력을 지녔는지 평가한다.
  • 가상 프롬프트를 인공 인문학 분야에서의 실증적이고 비교 가능한 연구 도구로 정립하며, AI 설계 및 인간-AI 상호작용에 대한 함의를 제시한다.

제안 방법

  • 250명의 Amazon Mechanical Turk 작업자와 GPT-3.5 및 GPT-4에서 유래한 80개 스토리에 동일한 가상 프롬프트(인간의 인공 인류를 창조하고 그와 사랑에 빠지는 것)를 적용한 통제된 실험을 수행하였다.
  • 서사학적 분석(플롯, 논술 방식, 배경)과 추론 통계 분석을 융합한 혼합 방법론을 사용하여 각 코퍼스 간의 서사 특징을 비교하였다.
  • 성별, 인종, 성적 지향의 표현을 측정하기 위해 정량적 분석을 적용하였으며, 역할 분포와 관계 역학을 중심으로 분석하였다.
  • 수사적 스타일, 상상력의 범위, 서사 혁신(플롯 트위스트 및 묘사어법 포함)을 평가하기 위해 정성적 비교 분석을 활용하였다.
  • 가상 서사문을 공동 상상력의 문화적 유물로 간주하여 인간과 LLM이 생성한 콘텐츠를 교차 분석할 수 있도록 하였다.
  • Pygmalion 신화를 문화적 렌즈로 활용하여 인간과 AI 스토리텔링에서 지속적인 서사 테마와 그 진화를 연구하였다.
Figure 1: Distribution of participant demographics.
Figure 1: Distribution of participant demographics.

실험 결과

연구 질문

  • RQ1인간과 LLM이 생성한 스토리텔링이 Pygmalion 신화의 서사적 구조와 주제적 내용을 어느 정도 반영하고 있는가?
  • RQ2Pygmalion 테마의 맥락에서 인간이 작성한 스토리와 AI가 생성한 스토리 간 성별 역할과 성적 지향 표현 방식은 어떻게 다를까?
  • RQ3GPT-3.5와 GPT-4가 생성한 스토리텔링은 인간이 작성한 스토리에 비해 서사 상상력, 수사적 스타일, 플롯 혁신 측면에서 어떤 방식으로 다를까?
  • RQ4LLM이 생성한 스토리텔링은 캐릭터 묘사와 역할 배정 측면에서 인종과 성별에 관한 사회적 편향을 어느 정도 반영하거나 강화하고 있는가?
  • RQ5가상 프롬프트는 인간과 인공지능이 생성한 스토리텔링에서의 문화적 상상력과 사회적 편향을 연구하는 데 신뢰성 있고 확장 가능한 도구로 기능할 수 있는가?

주요 결과

  • 모든 330개의 서사문(인간과 AI가 생성한 모두 포함)이 인공 인류의 과학적 또는 기술적 창조를 중심으로 하여, 현대 문화적 상상력에서 Pygmalion 신화의 광범위한 존재를 확인한다.
  • GPT-4는 물론 GPT-3.5 역시 인간이 작성한 스토리에 비해 성별 역할과 동성 간 관계 표현 측면에서 더 진보적인 경향을 보였으며, 특히 여성 캐릭터에게 전통적 역할을 초월한 비표준 역할을 배정하는 경향이 뚜렷했다.
  • 표현 측면에서의 진보성에도 불구하고, AI 스토리는 인간이 작성한 스토리에 비해 배경, 시나리오, 수사적 스타일 측면에서 상상력이 떨어졌으며, 인간 스토리는 더 화사하고 유머러스러운 언어를 다수 사용하였다.
  • GPT가 생성한 스토리는 종종 단순화된 도덕적 결론과 진부한 표현(예: '신이 되는 것' 또는 '행복한 환상')을 사용하여 더 좁은 서사 능력을 보여주었다.
  • AI 스토리는 명료성과 이해 가능성 측면에서 인간 스토리와 유사하거나 略로 뛰어났지만, 인간 스토리에서 관찰되는 서사 다양성과 창의적 리스크를 취하는 경향은 결여되어 있었다.
  • 본 연구는 AI가 생성한 스토리가 스타일적으로 일관되며 세대 간에 식별 가능하나, 서사 일반화 능력 측면에선 평균 인간 작가 수준에 머물러 있으며, 뚜렷한 서사 혁신이 부족하다는 점을 확인하였다.
Figure 2: Regression estimates from the model in Table 1 . Raw counts are given in 6 .
Figure 2: Regression estimates from the model in Table 1 . Raw counts are given in 6 .

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.