Skip to main content
QUICK REVIEW

[논문 리뷰] Large Language Models show both individual and collective creativity comparable to humans

Luning Sun, Yuzhuo Yuan|arXiv (Cornell University)|2024. 12. 04.
Machine Learning in Materials ScienceMaterials Science인용 수 3
한 줄 요약

이 연구는 창의적 사고, 문제 해결, 창의적 글쓰기 영역에 걸쳐 13개의 과제를 통해 대규모 언어 모델(Large Language Models, LLMs)의 창의적 역량을 평가하며, 개인 및 집단적 성능을 인간과 비교한다. 연구 결과, 최고 수준의 LLMs(Claude와 GPT-4)는 발산적 사고와 문제 해결에서 인간 수준의 창의성을 달성하며, 집단적 LLM 출력은 8~10명의 인간 협업자와 동등한 수준에 이르며, 향후 업무 환경에서 LLMs가 소규모 인간 팀과 경쟁할 수 있음을 시사한다.

ABSTRACT

Artificial intelligence has, so far, largely automated routine tasks, but what does it mean for the future of work if Large Language Models (LLMs) show creativity comparable to humans? To measure the creativity of LLMs holistically, the current study uses 13 creative tasks spanning three domains. We benchmark the LLMs against individual humans, and also take a novel approach by comparing them to the collective creativity of groups of humans. We find that the best LLMs (Claude and GPT-4) rank in the 52nd percentile against humans, and overall LLMs excel in divergent thinking and problem solving but lag in creative writing. When questioned 10 times, an LLM's collective creativity is equivalent to 8-10 humans. When more responses are requested, two additional responses of LLMs equal one extra human. Ultimately, LLMs, when optimally applied, may compete with a small group of humans in the future of work.

연구 동기 및 목표

  • 다양한 영역에서 대규모 언어 모델(Large Language Models, LLMs)이 인간과 비슷한 창의성을 보이는지 평가하는 것.
  • LLMs의 성능을 개인적 수준뿐 아니라 집단적 성능(팀처럼 행동하는 성능을 시뮬레이션함)으로 평가하는 것.
  • 다양한 창의적 과제에서 LLMs를 개인적 인간과 인간 그룹 모두와 비교하여 벤치마킹하는 것.
  • 여러 응답을 집계했을 때 LLM 창의성의 확장성(스케일러비리티)을 이해하는 것.
  • LLMs가 향후 일자리, 특히 창의적이고 협업 중심의 역할에 미치는 영향을 탐색하는 것.

제안 방법

  • 연구는 창의적 사고, 문제 해결, 창의적 글쓰기 영역에 걸쳐 13개의 창의적 과제를 활용한다.
  • LLMs는 개인 및 엔sembles(집단)로 평가되며, 각 과제당 10개의 응답을 생성하여 집단적 출력을 시뮬레이션한다.
  • 인간의 성능은 개인 및 그룹 응답을 통해 측정되며, 그룹은 8~10명의 참가자로 구성된다.
  • 모든 과제에서 표준화된 지표를 사용해 창의성 수준을 평가하며, 이는 원형성, 다양성, 실현 가능성 등을 포함한다.
  • 통계적 기준을 통해 LLM 성능을 개인적 인간과 인간 그룹과 비교하며, 성과 순위를 결정하기 위해 백분위수를 사용한다.
  • 연구는 GPT-4와 Claude를 선도적인 LLM으로 활용하며, 일관성과 확장성 측면에서 결과를 분석한다.

실험 결과

연구 질문

  • RQ1LLMs는 다양한 창의적 과제에서 개인적 인간과 비슷한 수준의 창의성을 달성할 수 있는가?
  • RQ2여러 응답을 생성함으로써 형성된 LLM의 집단적 창의성은 인간 그룹의 창의성과 비교해 어떻게 되는가?
  • RQ3LLMs는 어떤 창의적 영역에서 인간보다 뛰어나거나 열등한가?
  • RQ4집계된 LLM 출력이 창의적 업무에서 인간 팀 협업을 어느 정도 대체할 수 있는가?
  • RQ5생성된 응답 수가 증가함에 따라 LLM 창의성의 확장성은 어떻게 변화하는가?

주요 결과

  • 최고의 LLMs(Claude와 GPT-4)는 개인적 인간과 비교해 52번째 백분위수에 머물며, 거의 인간 수준의 창의성을 보임을 시사한다.
  • LLMs는 발산적 사고와 문제 해결 과제에서 뛰어나며, 다양한 실현 가능한 솔루션을 생성하는 데서 인간을 능가한다.
  • 창의적 글쓰기 과제에서는 인간의 독창성과 서사 깊이가 여전히 슈퍼어리어하여 LLMs가 열등하다.
  • LLM이 10번의 질의를 거쳐 생성한 집단적 출력은 8~10명의 인간 협업자 수준의 창의성을 보인다.
  • 매 2개의 추가 LLM 응답마다 집단 출력에 추가로 한 명의 인간 기여자에 상응하는 창의성이 추가된다.
  • 최적의 방식으로 적용될 경우, LLMs는 향후 창의적이고 협업 중심의 업무 환경에서 소규모 인간 팀과 경쟁할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.