Skip to main content
QUICK REVIEW

[논문 리뷰] I Cast Detect Thoughts: Learning to Converse and Guide with Intents and Theory-of-Mind in Dungeons and Dragons

Pei Zhou, Andrew Zhu|arXiv (Cornell University)|2022. 12. 20.
Software Engineering Research인용 수 9
한 줄 요약

이 논문은 의사소통 의도와 마음 이론(ToM)을 명시적으로 모델링하여 목표 지향적이고 맥락에 기반한 지시를 생성하도록 AI 덱스터 마스터를 훈련하기 위한 새로운 작업인 G4C를 소개한다. 의사소통 의도와 이론적 마음(ToM) 예측된 플레이어 반응 간의 일치를 보상하는 강화학습 프레임워크를 사용하여, 표준 자연어 생성(NLG) 대비 의도 이행 응답 비율을 3배로 높였다.

ABSTRACT

We propose a novel task, G4C, to study teacher-student natural language interactions in a goal-driven and grounded environment. Dungeons and Dragons (D&D), a role-playing game, provides an ideal setting to investigate such interactions. Here, the Dungeon Master (DM), i.e., the teacher, guides the actions of several players -- students, each with their own personas and abilities -- to achieve shared goals grounded in a fantasy world. Our approach is to decompose and model these interactions into (1) the DM's intent to guide players toward a given goal; (2) the DM's guidance utterance to the players expressing this intent; and (3) a theory-of-mind (ToM) model that anticipates the players' reaction to the guidance one turn into the future. We develop a novel reinforcement learning (RL) method for training a DM that generates guidance for players by rewarding utterances where the intent matches the ToM-anticipated player actions. Human and automated evaluations show that a DM trained to explicitly model intents and incorporate ToM of the players using RL generates better-quality guidance that is 3x more likely to fulfill the DM's intent than a vanilla natural language generation (NLG) approach.

연구 동기 및 목표

  • Dungeons & Dragons와 같은 상호작용 환경에서 목표 지향적이고 맥락에 기반한 자연어 소통을 연구한다.
  • 기존 대화 에이전트가 의사소통 의도와 마음 이론(ToM)을 명시적으로 모델링하지 못하는 격차를 해결한다.
  • 생성된 발화가 의도한 행동과 예측된 플레이어 반응 양쪽 모두와 일치하도록 하는 훈련 프레임워크를 개발한다.
  • 훈련 및 평가를 위해 의도와 ToM 주석이 추가된 대규모 고품질 데이터셋(G-Dragon)을 구축한다.
  • 의도 및 ToM 모델링의 명시적 적용이 AI 생성 지시의 통일성과 목표 지향성 향상에 기여하는지 평가한다.

제안 방법

  • 공동된 서사 세계에 기반한 세 구성 요소인 교사 의도, 지시 발화, 학습자 행동을 중심으로 G4C 작업을 구성한다.
  • Callison-Burch 등(2022)이 수집한 47,000건의 D&D 대화 기록을 바탕으로 역동적 모델링(IDM)을 사용해 의도 및 행동에 대한 고품질 레이블을 추출한다.
  • 대규모 언어 모델(GPT-3)에서 의사소통 의도를 추출하고, 이를 지시 생성의 명시적 맥락으로 사용한다.
  • 플레이어의 다음 행동을 ToM 모델을 사용해 예측하고, 예측된 행동이 덱스터 마스터의 의도한 행동과 일치하는지 여부에 따라 보상을 제공하는 강화학습(RL) 에이전트를 훈련시켜 지시를 생성한다.
  • ToM 예측 행동과 목표 의도 간의 비교를 통해 보상 함수를 설계하여, 의도 이행을 최적화할 수 있도록 한다.
  • 인간 평가 및 자동 평가 지표를 통합하여 생성된 지시의 맥락 기반성, 통일성, 의도 이행 정도를 평가한다.

실험 결과

연구 질문

  • RQ1의도를 명시적으로 모델링하면 목표 지향적이고 맥락에 기반한 대화에서 AI가 생성하는 지시의 품질이 향상되는가?
  • RQ2플레이어가 지시에 어떻게 반응할지 예측하는 마음 이론(ToM) 모델링은 AI 생성 발화의 효과성을 높일 수 있는가?
  • RQ3예측된 플레이어 행동과 의도한 행동을 일치시키는 강화학습 접근 방식이 의도 이행에 얼마나 기여하는가?
  • RQ4ToM를 통합한 RL 에이전트는 맥락 기반 서사 대화에서 표준 자연어 생성(NLG) 기반 베이스라인에 비해 성능이 뛰어나게 되는가?
  • RQ5자동 평가 지표와 인간 평가 지표는 복잡한 서사 기반 상호작용에서 의도 이행과 맥락 기반성을 신뢰성 있게 측정할 수 있는가?

주요 결과

  • 의도 모델링과 ToM 기반 강화학습을 적용한 덱스터 마스터는 표준 NLG 기반 베이스라인 대비 의도 이행 응답 비율이 3배 높게 생성한다.
  • ToM를 통합한 RL 에이전트는 의도 이행 비율 측정을 통해 덱스터 마스터의 의도와 플레이어의 실제 반응 간 일치도가 뚜렷이 향상됨을 확인했다.
  • 인간 평가 결과, ToM 강화 지시가 더 통일성 있고 맥락에 기반하며 목표 행동으로 유도하는 데 효과적임을 확인했다.
  • 자동 평가 지표는 인간 평가 결과와 강한 상관관계를 보이며, 맥락 기반성과 의도 이행 정도 평가에 유의미하게 활용될 수 있음을 검증했다.
  • 이 방법은 맥락에 적절하고 전략적으로 효과적인 서사 기반 역할 플레잉 게임에서의 지시 생성에서 표준 NLG를 능가한다.
  • 47,000건의 D&D 대화로 구성된 G-Dragon 데이터셋은 목표 지향적이고 맥락에 기반한 대화 시스템의 훈련 및 평가에 풍부한 고품질 자원을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.