[논문 리뷰] Playing the Werewolf game with artificial intelligence for language understanding
이 논문은 자연어 이해를 통해 거짓말을 탐지하고 상대를 속이며 전략적 투표를 통해 승리하는 데 목적이 있는 AI 에이전트인 Deep Wolf를 제안한다. 인간 플레이어의 게임 기록을 통해 미세조정된 트랜스포머 기반 모델로 훈련된 이 에이전트는 마을사람과 배신자 역할에서 평균 인간 플레이어 수준의 경쟁력을 보이며, 현재의 언어 모델이 사회적 추론 맥락에서 위장과 모순을 다룰 수 있음을 입증한다.
The Werewolf game is a social deduction game based on free natural language communication, in which players try to deceive others in order to survive. An important feature of this game is that a large portion of the conversations are false information, and the behavior of artificial intelligence (AI) in such a situation has not been widely investigated. The purpose of this study is to develop an AI agent that can play Werewolf through natural language conversations. First, we collected game logs from 15 human players. Next, we fine-tuned a Transformer-based pretrained language model to construct a value network that can predict a posterior probability of winning a game at any given phase of the game and given a candidate for the next action. We then developed an AI agent that can interact with humans and choose the best voting target on the basis of its probability from the value network. Lastly, we evaluated the performance of the agent by having it actually play the game with human players. We found that our AI agent, Deep Wolf, could play Werewolf as competitively as average human players in a villager or a betrayer role, whereas Deep Wolf was inferior to human players in a werewolf or a seer role. These results suggest that current language models have the capability to suspect what others are saying, tell a lie, or detect lies in conversations.
연구 동기 및 목표
- 자연어 통신을 사용해 워울브스 게임을 플레이할 수 있는 AI 에이전트를 개발하는 것—거짓말과 사회적 추론이 풍부한 분야.
- 사전 훈련된 언어 모델이 사회적 추론 맥락에서 거짓말을 탐지하고, 거짓을 만들며 타인의 역할에 대해 추론할 수 있는지 조사하는 것.
- 대화 기록을 기반으로 어떤 게임 상태에서 승리할 확률을 추정하는 가치 네트워크를 구축하는 것.
- 실제 게임에서 인간 플레이어와 대결할 때 AI 에이전트의 성능을 평가하고, 다양한 역할에서의 승률에 중점을 두는 것.
- 거짓말과 모순 탐지가 포함된 자연어 이해 분야에서 AI에 대한 새로운 벤치마크를 기여하는 것.
제안 방법
- 5명의 플레이어로 구성된 텍스트 기반 워울브스 게임에서 15명의 인간 플레이어로부터 48개의 게임 기록을 수집했으며, 메모리 제약로 인해 32개를 훈련에 사용.
- 일본어로 작성된 게임 기록을 영어로 번역하여 영어 언어 모델을 사용한 훈련을 가능하게 했다.
- 트랜스포머 기반 사전 훈련된 언어 모델을 미세조정하여, 게임 상태와 후보 행동이 주어졌을 때 승리 확률의 사후 확률을 예측하는 가치 네트워크를 구축.
- 가치 네트워크에서 예측한 승리 확률이 가장 높은 대상으로 투표 대상을 선택하는 AI 에이전트인 Deep Wolf를 설계.
- 실제 인간 플레이어와의 게임을 통해 에이전트를 평가하여 마을사람, 배신자, 워울브스, 예언자 등 다양한 역할에서의 승률을 측정.
- 가치 네트워크의 출력을 의사결정 히وري스틱으로 사용하여 불확실성 하에서 전략적 추론을 시뮬레이션하는 데 활용.
실험 결과
연구 질문
- RQ1인간 플레이어의 워울브스 게임 기록을 미세조정한 언어 모델이 실제 게임 플레이 중에 자신의 승리 확률을 실시간으로 추정할 수 있는가?
- RQ2AI 에이전트가 자연어 이해 능력을 활용해 거짓말을 탐지하고, 납득할 수 있는 허위 사실을 창출하며, 사회적 추론 게임에서 그룹 분위기를 조작할 수 있는 정도는 어느 정도인가?
- RQ3자연어 기록을 기반으로 훈련된 AI 에이전트의 성능은 마을사람, 워울브스, 예언자 등의 다양한 역할에서 평균 인간 플레이어와 비교해 어떻게 되는가?
- RQ4게임 기록을 기반으로 훈련된 가치 네트워크가 동적인 위장 대화 환경에서 투표 대상 선택과 같은 전략적 결정을 효과적으로 이끌 수 있는가?
- RQ5실제 인간-AI 워울브스 게임에서 AI 에이전트의 승률은 얼마이며, 이는 어떤 역할에 따라 어떻게 달라지는가?
주요 결과
- Deep Wolf는 마을사람이나 배신자 역할에서 평균 인간 플레이어 수준의 승률을 기록하여, 위장과 사회적 추론 능력이 뛰어나다는 것을 보여주었다.
- 워울브스나 예언자 역할에서 플레이할 경우 인간 플레이어보다 성능이 열 劣하였으며, 이는 역할 전용 전략 깊이나 역할 정체성 관리 능력에 한계가 있음을 시사한다.
- 가치 네트워크는 다양한 게임 단계에서 승리 확률을 성공적으로 예측하여, 대화 맥락을 바탕으로 한 정보 기반의 투표 결정을 가능하게 했다.
- 에이전트는 타인의 진술에서 모순을 탐지하고 이를 활용해 투표 결과에 영향을 주는 능력을 보이며 효과적인 거짓말 탐지 능력을 입증했다.
- Deep Wolf가 워울브스 역할로 플레이한 한 게임 샘플에서, 그는 순수한 무죄를 연기하고 다른 이들에게 의심을 향하게 하여 그룹을 조작함으로써 승리를 거두었다.
- 본 연구는 자연어 이해를 활용해 워울브스 게임을 플레이하는 AI 에이전트에 대한 첫 번째 실증적 평가를 제공하며, 다양한 역할에서 측정 가능한 승률을 확보했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.