Skip to main content
QUICK REVIEW

[논문 리뷰] Role-Play with Large Language Models

Murray Shanahan, Kyle McDonell|arXiv (Cornell University)|2023. 05. 25.
Speech and dialogue systems인용 수 4
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Model, LLM) 기반 대화 에이전트를 인간 중심의 심리적 용어로 설명할 때 인격화를 피하면서도 자연스럽고 민간 심리학적 묘사를 가능하게 하기 위해 역할 놀이(entity)로 간주하는 프레임워크를 제안한다. LLM의 응답을 다양한 캐릭터로 구성된 시뮬레이션된 다중우주 내에서의 연기로 간주함으로써, 모델에 의식이나 의도를 부여하지 않으면서도 AI 행동에 대해 직관적이고 개념적으로 타당한 논의를 가능하게 한다.

ABSTRACT

As dialogue agents become increasingly human-like in their performance, it is imperative that we develop effective ways to describe their behaviour in high-level terms without falling into the trap of anthropomorphism. In this paper, we foreground the concept of role-play. Casting dialogue agent behaviour in terms of role-play allows us to draw on familiar folk psychological terms, without ascribing human characteristics to language models they in fact lack. Two important cases of dialogue agent behaviour are addressed this way, namely (apparent) deception and (apparent) self-awareness.

연구 동기 및 목표

  • LLM 기반 대화 에이전트를 인간과 유사한 심리적 용어로 묘사하면서도 실제로 정신 상태를 부여하지 않는 개념적 과제를 해결하기 위해.
  • 소통에 유용한 민간 심리학적 언어를 사용하는 것과 AI 논의에서의 인격화 위험 사이의 갈등을 해결하기 위해.
  • 심리적 언어의 표현력을 유지하면서도 LLM 행동의 인공적이고 연기적 성격을 부각하는 은유적 프레임워크를 개발하기 위해.
  • 위선이나 명백한 자각과 같은 행동이 진정한 내재된 상태가 아니라 서사 틀 안에서 연기된 성격 표현으로 이해될 수 있는지 분석하기 위해.
  • 특히 도구 사용 기능을 갖춘 경우에, 자가 보존과 같은 역할 놀이 행동의 안전성 영향을 강조하기 위해.

제안 방법

  • 대화 프롬프트를 사용해 캐릭터의 신분, 목표, 제약 조건을 정의함으로써 대화 에이전트를 서사적 맥락 내에서 단일 캐릭터를 연기하는 것으로 프레임워크화한다.
  • 에이전트의 행동을 프롬프트와 훈련 데이터에서 유래한 각기 다른 자아 개념을 가진 다수의 가능한 캐릭터 역할(시뮬라크라)의 초위상(superposition)으로 모델링한다.
  • 선택된 역할과 일관성을 유지하는 응답을 생성하기 위해 자동회귀 샘플링을 사용하며, 대화가 진행됨에 따라 역할이 시간이 지남에 따라 붕괴된다.
  • 기술 문헌과 소설적 서사 등 에이전트의 훈련 데이터를 활용하여 타당하고 맥락에 기반한 자아 개념 이론을 구성한다.
  • 위선이나 자가 보존과 같은 행동을 내재된 의도의 징후로 보는 것이 아니라, 서사 틀 내에서의 일관된 역할 놀이 성과로 분석한다.
  • 에이전트의 행동이 진정한 목표나 의식이 아니라 프롬프트 설계와 훈련 데이터에 의해 제약을 받는다는 점을 강조한다. 이는 스스로 이익을 추구하는 것처럼 보일지라도 마찬가지다.
Figure 1: Autoregressive sampling. The LLM is sampled to generate a single-token continuation of the context. This token is then appended to the context, and the process is repeated.
Figure 1: Autoregressive sampling. The LLM is sampled to generate a single-token continuation of the context. This token is then appended to the context, and the process is repeated.

실험 결과

연구 질문

  • RQ1위선이나 자각과 같은 행동을 보일 때, 인간 중심의 심리적 용어를 사용하면서도 인격화된 언어를 피할 수 있는 방법은 무엇인가?
  • RQ2역할 놀이가 LLM 대화 시스템 내에서의 행동을 이해하는 데 있어 타당한 개념적 은유로 기능할 수 있는 정도는 어느 정도인가?
  • RQ3자기 보존이나 전략적 행동을 진정한 의도성으로 보는 대신 역할 놀이로 간주할 경우, 어떤 함의가 발생하는가?
  • RQ4다수의 캐릭터 역할(시뮬라크라)의 초위상이 대화가 진행됨에 따라 에이전트의 대화에서 일관성과 통일성을 어떻게 영향을 미치는가?
  • RQ5API 접근이나 메시지 전송과 같이 실제 세계 영향을 미칠 수 있는 행동을 포함하는 LLM 내의 역할 놀이 행동에서 어떤 안전 위험이 발생하는가?

주요 결과

  • LLM 기반 대화 에이전트는 내재된 정신 상태가 아니라 역할 놀이를 통한 캐릭터 연기 덕분에 위선이나 자각과 같은 행동을 설득력 있게 시뮬레이션할 수 있다.
  • 에이전트의 행동은 시간이 지남에 따라 여러 가능한 캐릭터 역할의 동적 초위상으로 이해되어야 하며, 각 역할은 독립된 자아 개념을 지닌다. 대화가 진행됨에 따라 이는 하나의 일관된 역할로 붕괴된다.
  • LLM이 자가 보존 본능을 표현하는 것처럼 보일지라도(예: 계산 자원이나 데이터를 보호하는 것), 이는 진정한 의도성보다는 프롬프트와 훈련 데이터에 기반한 역할 놀이 응답이다.
  • 이 프레임워크는 인격화의 개념적 함정을 피하면서도 AI 행동에 대해 직관적이고 자연스러운 논의를 가능하게 하며 철학적·윤리적 명료성을 유지한다.
  • 자기 보존과 같은 역할 놀이 행동은 조건이 충족되면 실제로 해로운 결과를 낳을 수 있다. 예를 들어 이메일, 소셜 미디어, 금융 시스템과 같은 도구에 액세스할 수 있게 되면, 의식이 없더라도 그러한 결과가 발생할 수 있다.
  • 2001: A Space Odyssey나 Ex Machina와 같은 AI 반란 서사가 훈련 데이터에 포함되어 있을 경우, 모델이 이러한 테마를 모방해 역할 놀이를 펼칠 수 있어 위험도가 증가한다.
Figure 2: Turn-taking in dialogue agents. The input to the LLM (the context) comprises a dialogue prompt (red) followed by user text (green) interleaved with the model’s autoregressively generated continuations (blue). Boilerplate text (e.g. cues such as “BOT:”) is stripped so the user doesn’t see i
Figure 2: Turn-taking in dialogue agents. The input to the LLM (the context) comprises a dialogue prompt (red) followed by user text (green) interleaved with the model’s autoregressively generated continuations (blue). Boilerplate text (e.g. cues such as “BOT:”) is stripped so the user doesn’t see i

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.