[논문 리뷰] Artificial Intelligence versus Maya Angelou: Experimental evidence that people cannot differentiate AI-generated from human-written poetry
이 연구는 사람들이 GPT-2를 사용해 생성한 인공지능 시를 인간이 쓴 시와 구별할 수 있는지 조사한다. 830명의 참가자가 참여한 통제된 실험에서, 최고의 출력을 선택한 경우(사람이 개입하는 방식), 참가자들은 인공지능이 생성한 시를 신뢰성 있게 식별하지 못했지만, 무작위 출력을 사용한 경우(사람이 개입하지 않는 방식), 식별할 수 있었다. 이는 고도로 인간다운 텍스트 생성 능력을 가짐을 시사한다. 또한 참가자들은 시의 출처가 어떻게 공개되었는지에 관계없이 인공지능 시에 약간의 거부감을 보였다.
The release of openly available, robust natural language generation algorithms (NLG) has spurred much public attention and debate. One reason lies in the algorithms' purported ability to generate human-like text across various domains. Empirical evidence using incentivized tasks to assess whether people (a) can distinguish and (b) prefer algorithm-generated versus human-written text is lacking. We conducted two experiments assessing behavioral reactions to the state-of-the-art Natural Language Generation algorithm GPT-2 (Ntotal = 830). Using the identical starting lines of human poems, GPT-2 produced samples of poems. From these samples, either a random poem was chosen (Human-out-of-the-loop) or the best one was selected (Human-in-the-loop) and in turn matched with a human-written poem. In a new incentivized version of the Turing Test, participants failed to reliably detect the algorithmically-generated poems in the Human-in-the-loop treatment, yet succeeded in the Human-out-of-the-loop treatment. Further, people reveal a slight aversion to algorithm-generated poetry, independent on whether participants were informed about the algorithmic origin of the poem (Transparency) or not (Opacity). We discuss what these results convey about the performance of NLG algorithms to produce human-like text and propose methodologies to study such learning algorithms in human-agent experimental settings.
연구 동기 및 목표
- 사람들이 신뢰성 있게 인공지능이 생성한 시와 인간이 쓴 시를 구별할 수 있는지 평가하는 것.
- 통제된 실험 환경에서 인공지능이 생성한 시와 인간이 쓴 시에 대한 선호도를 조사하는 것.
- 원천의 투명성(출처를 알고 있는지 여부)이 인공지능 텍스트에 대한 인식과 선호도에 미치는 영향을 평가하는 것.
- GPT-2와 같은 최신 자연어 생성(NLG) 모델이 인간다운 시적 텍스트를 생성하는 데 얼마나 효과적인지 테스트하는 것.
- 생성형 AI를 포함한 실험적 설정에서 인간-에이전트 상호작용을 연구하기 위한 방법론을 개발하는 것.
제안 방법
- 830명의 참가자가 참여한 인센티브 기반의 두 개의 실험을 실시하였으며, 인간의 시에서 동일한 시작 문장을 사용하였다.
- 동일한 시작 문장을 바탕으로 GPT-2를 사용해 시 샘플을 생성하였으며, 최고의 출력을 선택한 경우(사람이 개입하는 방식)와 무작위 출력을 선택한 경우(사람이 개입하지 않는 방식)를 구분하였다.
- 각 인공지능이 생성한 시와 유사한 품질의 인간이 쓴 시를 매칭하여 비교하였다.
- 검출 정확도와 선호도를 평가하기 위해 새로운 인센티브 기반의 튜링 테스트 변형을 구현하였다.
- 편향을 평가하기 위해 원천의 투명성(참가자들이 인공지능 출처를 알게 됨)과 투명성 부재(정보 제공 없음) 조건을 다양화하였다.
- 통제된 双각각 실험 설계를 통해 검출 정확도와 선호도에 대한 행동 반응을 수집하였다.
실험 결과
연구 질문
- RQ1GPT-2에서 최고의 출력이 사용될 경우, 참가자들이 인공지능이 생성한 시를 신뢰성 있게 식별할 수 있는가?
- RQ2출력 선택 방법(최고의 출력 대비 무작위 출력)이 참가자들이 인공지능 시와 인간 시를 구별하는 데 영향을 미치는가?
- RQ3참가자들은 인간이 쓴 시나 인공지능이 생성한 시 중 어느 쪽을 더 선호하는가? 이 선호도는 출처의 투명성 여부에 따라 달라지는가?
- RQ4시의 알고리즘적 출처에 대한 투명성이 시의 품질에 대한 인식과 평가에 어떻게 영향을 미치는가?
- RQ5GPT-2와 같은 최신 자연어 생성(NLG) 모델이 창작 분야인 시와 같은 분야에서 인간의 글쓰기와 구분하기 어려운 텍스트를 얼마나 잘 생성하는가?
주요 결과
- 최고의 GPT-2 출력이 선택된 사람의 개입이 있는 조건에서 참가자들은 인공지능이 생성한 시를 신뢰성 있게 식별하지 못했으며, 이는 강력한 인간다움을 나타낸다.
- 무작위 GPT-2 출력이 사용된 사람의 개입이 없는 조건에서는 참가자들이 인공지능이 생성한 시를 성공적으로 식별했으며, 이는 출력 품질의 변동성이 식별 가능성에 영향을 준다는 것을 시사한다.
- 참가자들은 출처가 투명한지 여부에 관계없이 인공지능 시에 약간의 거부감을 보였다.
- 이 연구는 최신 자연어 생성(NLG) 모델이 GPT-2와 같이 최적의 조건에서 인간의 글쓰기와 거의 구분되지 않는 시를 생성할 수 있음을 실증적으로 입증한다.
- 결과적으로 현재의 자연어 생성 시스템이 창작 분야에서 인간의 인지 테스트를 통과할 수 있는 텍스트를 생성할 수 있음을 보여주며, 인간의 예술적 표현에서의 고유성에 대한 기존의 가정을 도전한다.
- 이 연구는 생성형 AI를 포함한 실험적 설정에서 인간-에이전트 상호작용을 연구하기 위한 새로운 방법론 프레임워크의 필요성을 부각시킨다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.