Skip to main content
QUICK REVIEW

[논문 리뷰] Artificial muses: Generative Artificial Intelligence Chatbots Have Risen to Human-Level Creativity

Jennifer Haase, Paul H. P. Hanel|arXiv (Cornell University)|2023. 03. 21.
Creativity in Education and Neuroscience참고 문헌 43인용 수 42
한 줄 요약

이 연구는 생성형 AI 채팅봇(GAI)이 창의성 테스트인 대체 용도 테스트(ALT)를 통해 인간 수준의 창의성을 달성하는지 평가한다. 100명의 인간과 GPT-4 포함 6종의 GAI 모델을 대상으로 아이디어 유량과 독창성에 대해 비교 분석하였다. 결과적으로 최고 수준의 GAI와 인간 간 창의성의 질적 차이가 없음을 확인하였으며, GPT-4의 독창성 수준을 초월한 인간은 9.4%에 달하여, 진정한 의도성의 결여에도 불구하고 GAI는 강력한 창의적 보조 수단으로 기능할 수 있음을 시사한다.

ABSTRACT

A widespread view is that Artificial Intelligence cannot be creative. We tested this assumption by comparing human-generated ideas with those generated by six Generative Artificial Intelligence (GAI) chatbots: $alpa.\!ai$, $Copy.\!ai$, ChatGPT (versions 3 and 4), $Studio.\!ai$, and YouChat. Humans and a specifically trained AI independently assessed the quality and quantity of ideas. We found no qualitative difference between AI and human-generated creativity, although there are differences in how ideas are generated. Interestingly, 9.4 percent of humans were more creative than the most creative GAI, GPT-4. Our findings suggest that GAIs are valuable assistants in the creative process. Continued research and development of GAI in creative tasks is crucial to fully understand this technology's potential benefits and drawbacks in shaping the future of creativity. Finally, we discuss the question of whether GAIs are capable of being truly creative.

연구 동기 및 목표

  • 생성형 AI가 창의적일 수 없다는 널리 퍼진 믿음을 검증하기 위해 GAI가 생성한 아이디어와 인간이 생성한 아이디어를 비교한다.
  • 생성형 AI 채팅봇이 일상적인 창의적 과제에서 인간과 비슷한 수준의 품질과 독창성을 가진 아이디어를 생성할 수 있는지 평가한다.
  • GAI가 창의적 과정, 특히 아이디어 생성 과정에서 효과적인 보조 수단이 될 수 있는지 탐구한다.
  • GAI의 출력물이 사회적 맥락에서 새로운가 되고 유용한지를 얼마나 충족하는지 조사한다.

제안 방법

  • 100명의 인간 참가자에게 대체 용도 테스트(AUT)를 시행하여, 편지, 칫솔 등 5종의 일반 물체에 대해 다양한 활용 방법을 제시하도록 요청하였다.
  • 알파.에이아이, 코피.에이아이, 챗지피티-3, 챗지피티-4, 스투디오.에이아이, 유체치를 포함한 6종의 GAI 모델에서 응답을 수집하였다.
  • 모든 응답의 독창성과 유량을 평가하기 위해 인간 평가자와 별도로 훈련된 AI 모델을 활용하였다.
  • 편산 사고 평가 기준에 따라 표준화된 점수 체계를 적용하였으며, 주로 아이디어 유량(생산된 아이디어 수)과 독창성(기준 샘플 대비 고유성)을 중심으로 분석하였다.
  • 인간 평가자와 AI 평가자 간 일致성 확보를 위해 회귀 계수(ICC)를 활용한 상호 평가자 신뢰도 검증을 실시하였다.
  • 객체 및 평가자 간 변동성을 고려하기 위해 혼합 효과 모델을 적용하였으며, 유의성 수준은 p < 0.05로 설정하였다.

실험 결과

연구 질문

  • RQ1생성형 AI 채팅봇이 인간이 생성한 것과 동일한 수준의 창의성을 보이는 아이디어를 생성하는가?
  • RQ2최고 수준의 GAI(GPT-4)와 인간 참가자 간 독창성과 유량에 유의미한 차이가 존재하는가?
  • RQ3GAI는 창의적 과정, 특히 아이디어 생성 과정에서 신뢰할 수 있는 보조 수단으로 간주될 수 있는가?
  • RQ4인간 참가자 중 GAI의 가장 창의적인 출력물보다 독창성이 뛰어난 경우가 얼마나 되는가?

주요 결과

  • 최고 수준의 GAI(GPT-4)와 인간 참가자 간 아이디어의 독창성 또는 유량에 유의미한 질적 차이가 없었다.
  • GPT-4가 생성한 아이디어는 독창성과 수량 측면에서 인간이 생성한 아이디어와 통계적으로 구분되지 않았다.
  • 인간 참가자 중 9.4%가 GPT-4의 가장 창의적인 출력물보다 더 독창적인 아이디어를 생성하여, 인간 창의성이 소수의 사례에서 여전히 GAI를 뛰어넘는다는 것을 시사한다.
  • 연구 결과, GAI의 출력물은 인간 평가자와 AI 평가자 모두로부터 새로운 것으로 평가되어 '창의적' 출력이라는 인식을 뒷받침한다.
  • 결과적으로 GAI, 특히 GPT-4는 빠른 아이디어 생성이 요구되는 과제에서 효과적인 보조 수단으로 기능할 수 있음을 시사한다.
  • 높은 성능에도 불구하고 GAI의 출력물은 프롬프트의 품질에 의존하며, 인간 창의성의 전면적 인지적·정서적 맥락을 갖추지 못하고 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.