Skip to main content
QUICK REVIEW

[논문 리뷰] How Well Can LLMs Echo Us? Evaluating AI Chatbots' Role-Play Ability with ECHO

Man Tik Ng, Hui Tung Tse|arXiv (Cornell University)|2024. 04. 22.
Artificial Intelligence in Healthcare and EducationMedicine인용 수 3
한 줄 요약

이 논문은 실제 개인의 프로필을 사용하여 일상인으로서의 역할을 수행하는 데 테일러 테스트를 영감으로 삼은 ECHO를 소개한다. GPTs는 지인들을 속이는 데 48.3%의 성공률을 기록하며, GPT-3.5와 GPT-4를 능가했고, GPT-4와 같은 LLM은 기계가 생성한 텍스트를 식별할 수 있지만 인간이 작성한 내용을 식별하는 데는 어려움을 겪어 모델에 따라 특이한 편향이 드러났다.

ABSTRACT

The role-play ability of Large Language Models (LLMs) has emerged as a popular research direction. However, existing studies focus on imitating well-known public figures or fictional characters, overlooking the potential for simulating ordinary individuals. Such an oversight limits the potential for advancements in digital human clones and non-player characters in video games. To bridge this gap, we introduce ECHO, an evaluative framework inspired by the Turing test. This framework engages the acquaintances of the target individuals to distinguish between human and machine-generated responses. Notably, our framework focuses on emulating average individuals rather than historical or fictional figures, presenting a unique advantage to apply the Turing Test. We evaluated three role-playing LLMs using ECHO, with GPT-3.5 and GPT-4 serving as foundational models, alongside the online application GPTs from OpenAI. Our results demonstrate that GPT-4 more effectively deceives human evaluators, and GPTs achieves a leading success rate of 48.3%. Furthermore, we investigated whether LLMs could discern between human-generated and machine-generated texts. While GPT-4 can identify differences, it could not determine which texts were human-produced. Our code and results of reproducing the role-playing LLMs are made publicly available via https://github.com/CUHK-ARISE/ECHO.

연구 동기 및 목표

  • 유명인이나 허구의 캐릭터가 아닌 평범한 개인을 모방하는 데 있어 LLM 평가의 격차를 해소하기 위해.
  • 실제 인간의 프로필을 사용해 테일러 테스트 기반의 LLM 역할 놀이 평가 프레임워크를 개발하기 위해.
  • LLM이 인간이 작성한 텍스트와 기계가 생성한 텍스트를 정확히 식별할 수 있는지 평가하고, 그 판단에 잠재된 편향을 파악하기 위해.
  • 참가자의 개인정보를 보호하고 사전 동의를 확보함으로써 윤리적인 데이터 처리를 보장하기 위해.
  • 실제 개인 데이터를 사용해 역할 놀이 LLM 평가를 위한 재현 가능한 벤치마크를 제공하기 위해.

제안 방법

  • ECHO는 10명의 실제 개인으로부터 인구통계학적 정보, 관심사, 의사소통 스타일 등의 배경 데이터를 활용해 역할 놀이 LLM을 구축한다.
  • 목표 개인의 지인인 인간 평가자들이 실제 사람의 응답과 LLM이 생성한 응답을 식별하도록 한다.
  • 네 가지 역할 놀이 방법(즉, RoleGPT, Juliet, Role-Play Prompting(RPP), OpenAI의 GPTs)을 비교하며, 기초 모델로 GPT-3.5-Turbo와 GPT-4-Turbo를 사용한다.
  • 진정성과 일관성을 테스트하기 위해 개인의 역사, 선호도, 현재 상황 등의 분야에서 10종류의 질문을 포함한다.
  • 제어 실험을 통해 GPT-4나 Gemini-Pro와 같은 LLM이 인간이 작성한 응답과 기계가 생성한 응답을 구분할 수 있는지 평가하며, 편향과 정확도를 측정한다.
  • 모든 개인 정보는 현지에서 처리되며, 제3자와 공유되지 않으며, 모든 응답은 6개월 후 삭제되어 개인정보 보호를 확보한다.

실험 결과

연구 질문

  • RQ1인간 평가자들이 실제 응답과 합성 응답을 구분할 수 있는 능력으로 측정했을 때, LLM은 일상인으로서의 역할 놀이에서 효과적으로 모방할 수 있는가?
  • RQ2GPTs, RoleGPT, RPP 등의 다양한 역할 놀이 방법이 목표 개인의 지인을 속이는 데 있어 성능에 어떤 차이가 있는가?
  • RQ3LLM은 주어진 텍스트가 인간이 작성했는지 다른 LLM이 생성했는지 정확히 식별할 수 있으며, 그 판단에 편향을 보이는가?
  • RQ4LLM이 인간이 작성한 텍스트와 기계가 생성한 텍스트를 평가할 때, 모델 유사성이나 텍스트 길이 측면에서 어떤 내재된 편향이 존재하는가?
  • RQ5LLM은 감정 깊이, 문화적 맥락, 개인적인 의사소통 패턴과 같은 미세한 인간의 특징을 어느 정도 잘 재현하지 못하는가?

주요 결과

  • GPTs는 모든 역할 놀이 방법에서 GPT-3.5와 GPT-4를 능가해 가장 높은 48.3%의 속임성 성공률 기록.
  • GPT-4는 GPT-3.5보다 뛰어난 역할 놀이 능력을 보이며, 테스트된 모델들 중에서 높은 속임성 비율 기록.
  • GPT-4와 GPT-4-Turbo는 기계가 생성한 텍스트와 인간이 작성한 텍스트를 식별하는 데 각각 90% 이상의 성공률 기록하여 강력한 식별 능력을 보임.
  • 강력한 식별 성능에도 불구하고, GPT-4는 인간이 작성한 텍스트를 신뢰할 수 있게 식별하지 못해 자신의 생성 패tern을 더 많이 식별하는 경향이 있음.
  • GPT-4는 지시어 편향을 보였으며, 설정 간 정확도 격차가 63.5%에 이르러 인간이 작성한 텍스트를 식별하는 데는 기계가 생성한 텍스트를 식별하는 것만큼 확신이 없음.
  • 제어 모델과의 비교를 통해 LLM이 인간과 기계 생성 텍스트를 구분할 능력에 길이에 따른 유의미한 길이 편향이 관찰되지 않았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.