[논문 리뷰] Does GPT-4 pass the Turing test?
본 연구는 공개 온라인 튜링 테스트에서 GPT-4를 평가하여 GPT-4 프롬프트가 인간 63%에 비해 최대 41%의 성공을 달성하고 프롬프트에 의한 변동성이 크며 해석자 인구통계와 정확도 사이에 명확한 연결 고리가 없다.
We evaluated GPT-4 in a public online Turing test. The best-performing GPT-4 prompt passed in 49.7% of games, outperforming ELIZA (22%) and GPT-3.5 (20%), but falling short of the baseline set by human participants (66%). Participants' decisions were based mainly on linguistic style (35%) and socioemotional traits (27%), supporting the idea that intelligence, narrowly conceived, is not sufficient to pass the Turing test. Participant knowledge about LLMs and number of games played positively correlated with accuracy in detecting AI, suggesting learning and practice as possible strategies to mitigate deception. Despite known limitations as a test of intelligence, we argue that the Turing test continues to be relevant as an assessment of naturalistic communication and deception. AI models with the ability to masquerade as humans could have widespread societal consequences, and we analyse the effectiveness of different strategies and criteria for judging humanlikeness.
연구 동기 및 목표
- GPT-4가 온라인 튜링 테스트에서 인간으로 오인될 수 있는지 여부를 평가한다.
- 다양한 프롬프트를 통해 GPT-4를 GPT-3.5 및 ELIZA 기반과 비교한다.
- 프롬프트 설계, 전략 및 면담자 특성이 합격 가능성에 미치는 영향을 분석한다.
- 튜링 테스트가 자연스러운 의사소통과 기만 연구에 왜 여전히 관련 있는지 설명한다.
제안 방법
- 인터로온라인 두 명의 플레이어가 있는 튜링 테스트를 면담자와 증인으로 구현했다.
- varied prompts 및 매개변수(온도, 페르소나, 오류, AI-vs-human 프레이밍)를 사용하여 GPT-3.5 또는 GPT-4로 25명의 AI 증인을 생성했다.
- 제한 시간/길이, 입력 지연, 판정 및 신뢰도에 대한 의사결정 로그를 포함한 채팅 인터페이스를 구현했다.
- turingtest.live에서 인간 증인 또는 AI 증인으로 무작위 배정과 증인을 위한 AI-탐색/활용 모델 선택기를 사용한 실험을 수행했다.
- 인구통계 데이터 수집 및 면담자 전략, 판정 이유, 프롬프트 간 성능을 분석했다.
- GPT-4 프롬프트를 GPT-3.5 프롬프트 및 ELIZA 기반과 비교했다.
실험 결과
연구 질문
- RQ1온라인 튜링 테스트에서 GPT-4의 성공률은 인간 및 기본 모델(ELIZA, GPT-3.5)와 비교하여 어느 정도인가?
- RQ2대화 맥락에서 프롬프트 설계가 GPT-4의 인간으로 통과하는 능력에 어떤 영향을 미치는가?
- RQ3AI vs 인간에 대한 올바른 식별을 예측하는 면담자 전략과 참가자 인구통계는 무엇인가?
- RQ4면담자들이 AI vs 인간 판정에 대해 어떤 이유를 제시하며 이것이 인간 유사성 신호에 대해 무엇을 나타내는가?
- RQ5작업 경험(게임 수)이 면담자 정확도나 신뢰도에 영향을 미치는가?
주요 결과
- GPT-4의 최적 프롬프트는 41%의 성공률을 달성하여 ELIZA(27%) 및 GPT-3.5 기반(5–14%)보다 뛰어나지만 인간의 성능(63%)에는 크게 미치지 못한다.
- GPT-4 성능에는 프롬프트 간 큰 변동성이 있으며 일부 프롬프트는 대략 6–26%, 다른 프롬트는 대략 40–41% 수준이다.
- AI 증인에 대한 면담자 정확도는 인구통계나 LLM과의 선행 상호작용으로 예측되지 않았고, 실험 내 학습 효과가 정확도에 유의하게 영향을 미치지 않았다.
- 언어적 스타일과 사회정서 신호가 AI-대 인간 판단의 최상 요인이었으며, 진정한 지식이나 추론의 증거보다는 이러한 신호가 더 중요했다.
- ELIZA는 간단함에도 불구하고 게임의 27%에서 인간 면담자를 속였으며, ELIZA 효과와 튜링 테스트가 지능의 척도로서의 한계를 강조한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.