Skip to main content
QUICK REVIEW

[논문 리뷰] Pron vs Prompt: Can Large Language Models already Challenge a World-Class Fiction Author at Creative Text Writing?

Guillermo Marco, Julio A. Gonzalo|arXiv (Cornell University)|2024. 07. 01.
Digital Humanities and ScholarshipArts and Humanities인용 수 3
한 줄 요약

이 연구는 GPT-4와 평단의 평가를 받은 소설가 파트리시오 프론 사이의 통제된 대결을 통해, 자가 생성 및 상대방이 제공한 제목을 바탕으로 한 60편의 단편 소설 개요를 바탕으로 창작적 글쓰기 능력을 평가한다. GPT-4의 유창성과 일관성에도 불구하고 전문가들은 인간이 작성한 작품이 더 독창적이고 감정적으로 영향을 주며 창작적 가치가 높다고 평가했으며, 이는 LLM이 아직도 확률적 패턴 매칭에 의존할 뿐 깊은 의도나 진정한 신선함이 없는 최고 수준의 인간 창의성에 뒤지고 있음을 시사한다.

ABSTRACT

It has become routine to report research results where Large Language Models (LLMs) outperform average humans in a wide range of language-related tasks, and creative text writing is no exception. It seems natural, then, to raise the bid: Are LLMs ready to compete in creative writing skills with a top (rather than average) novelist? To provide an initial answer for this question, we have carried out a contest between Patricio Pron (an awarded novelist, considered one of the best of his generation) and GPT-4 (one of the top performing LLMs), in the spirit of AI-human duels such as DeepBlue vs Kasparov and AlphaGo vs Lee Sidol. We asked Pron and GPT-4 to provide thirty titles each, and then to write short stories for both their titles and their opponent's. Then, we prepared an evaluation rubric inspired by Boden's definition of creativity, and we collected 5,400 manual assessments provided by literature critics and scholars. The results of our experimentation indicate that LLMs are still far from challenging a top human creative writer, and that reaching such level of autonomous creative writing skills probably cannot be reached simply with larger language models.

연구 동기 및 목표

  • 최신 기술의 LLM인 GPT-4가 자율적이고 제약이 없는 과제에서 세계적 수준의 소설가의 창작적 글쓰기 수준에 도달할 수 있는지 경험적으로 평가하는 것.
  • 프롬프트의 출처(자신이 생성한 것 vs. 상대방의 제목)가 인간 및 AI 글쓰기의 창작적 결과에 미치는 영향을 조사하는 것.
  • LLM이 창작적 글쓰기에서 감지 가능한 스타일적 특징을 보이며, 전문가들이 AI 생성 텍스트와 인간이 작성한 텍스트를 신뢰성 있게 구별할 수 있는지 평가하는 것.
  • 특히 영어와 스페인어로 생성된 GPT-4의 성능 격차가 존재하는지 조사하는 것.
  • 전문가 평가를 통해 보든의 창의성 프레임워크(신선함, 놀라움, 가치)가 AI 생성 창작 텍스트 평가에 적용 가능한지 검증하는 것.

제안 방법

  • 대칭적인 글쓰기 대회를 실시: 파트리시오 프론과 GPT-4는 각각 30개의 원본 제목을 생성하고, 총 60편의 단편 소설 개요를 작성함(자신의 제목 30편, 상대의 제목 30편).
  • 마거릿 보든의 창의성 프레임워크를 기반으로 한 맞춤형 평가 척도를 사용하여, 창의성의 핵심 요소인 신선함, 놀라움, 가치에 중점을 두었으며, 문학 평론가 및 학자들이 총 5,400건의 수작업 평가를 수행함.
  • 맹글리 평가를 실시: 평가자가 텍스트의 저자를 알 수 없도록 하였으며, 각 텍스트가 인간이 작성한 것인지 AI가 생성한 것인지 식별하도록 했음.
  • GPT-4의 영어 및 스페인어 성능을 비교하여 언어별 성능 격차를 분석하였으며, 스페인어 텍스트는 다국어 전문가들이 평가함.
  • 엄격한 프롬프트 일관성 유지: GPT-4에 대해 피니테이닝이나 스타일 제약을 적용하지 않아 동일한 조건에서 자율적 생성을 확보함.
  • 평가 과정이 진행됨에 따라 전문가가 AI 생성 텍스트를 식별하는 데의 정확도 변화를 수집하여, 시간이 지남에 따라 식별 능력 향상 여부를 분석함.

실험 결과

연구 질문

  • RQ1RQ1: 현재의 생성형 AI가 창작적 글쓰기 과제에서 최고 수준의 인간 작가의 실력을 따라할 수 있는가?
  • RQ2RQ2: 프롬프트(특히 상대방의 제목)가 생성된 텍스트의 창의성에 미치는 역할은 무엇인가? 특히 상대의 제목이 프롬프트로 사용될 경우에 대해.
  • RQ3RQ3: GPT-4는 영어 이외의 언어, 예를 들어 스페인어와 같은 언어에서 창작적 글쓰기 능력이 떨어지는가?
  • RQ4RQ4: 제약 없이 창작적 텍스트를 생성할 때, 문학 전문가가 GPT-4의 스타일을 식별할 수 있는가?
  • RQ5RQ5: 보든의 프레임워크를 통해 AI 생성 텍스트의 창의성에 효과적으로 측정할 수 있는가?

주요 결과

  • GPT-4의 텍스트는 전문가 평가자들에 의해 인간이 작성한 텍스트보다 항상 더 유창하고 일관성 있게 평가되었지만, 독창성, 감정 깊이, 인지된 가치 측면에서 유의미하게 낮게 평가됨.
  • 인간이 작성한 이야기는 더 놀라움과 신선함을 더해, 전문가 평가의 68%가 GPT-4의 출력보다 더 높은 창의성 점수를 기록함.
  • 전문가들은 평균 72%의 정확도로 GPT-4가 생성한 텍스트를 식별했으며, 평가 과정이 진행됨에 따라 이 정확도가 약간 향상되어 감지 가능한 스타일 패tern이 존재함을 시사함.
  • GPT-4는 영어보다 스페인어에서 성능이 떨어졌으며, 평균 창의성 점수에서 14% 하락을 보였고, 이는 자원이 풍부한 언어에서도 성능 격차가 존재함을 시사함.
  • 높은 유창성에도 불구하고 GPT-4의 출력은 의도적이거나 진정으로 독창적인 창작적 사고보다는 확률적 패턴 매칭에 의존한다는 인식이 지배적임.
  • 유창성과 창의성 사이에 강한 상관관계가 없음을 발견하여, 높은 유창성이 AI 생성 텍스트에서 높은 창의적 가치를 의미하지는 않음을 시사함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.