Skip to main content
QUICK REVIEW

[논문 리뷰] Dialogue Shaping: Empowering Agents through NPC Interaction

Wei Zhou, Xiangyu Peng|arXiv (Cornell University)|2023. 07. 28.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 대화 형식의 대화 체계(Dialogue Shaping)를 제안하며, 대화 기반 게임에서 비플레이어 캐릭터(NPC)와 대화를 나누고, 핵심 게임 지식을 추출하여 지식 그래프로 변환함으로써 강화학습(RL) 에이전트 훈련을 가속화하는 프레임워크를 사용한다. 이 방법은 기준선 에이전트 대비 RL 수렴 시간을 80% 이상 단축시키며, 기준선 대비 약 10,000단계에서 최적의 정책에 도달하는 데 성공한다.

ABSTRACT

One major challenge in reinforcement learning (RL) is the large amount of steps for the RL agent needs to converge in the training process and learn the optimal policy, especially in text-based game environments where the action space is extensive. However, non-player characters (NPCs) sometimes hold some key information about the game, which can potentially help to train RL agents faster. Thus, this paper explores how to interact and converse with NPC agents to get the key information using large language models (LLMs), as well as incorporate this information to speed up RL agent's training using knowledge graphs (KGs) and Story Shaping.

연구 동기 및 목표

  • 텍스트 기반 게임에서 행동 공간이 매우 넓고 보상 신호가 희박한 상황에서 강화학습(RL) 에이전트의 수렴 속도가 느린 문제를 해결하기 위해.
  • NPC와의 대화적 상호작용이 RL 에이전트의 효율적인 지도를 위해 실질적인 게임 지식을 추출할 수 있는지 탐색하기 위해.
  • 지식 그래프와 스토리 형식의 구조를 통해 LLM에서 유도된 지식을 RL 훈련에 통합하여 정책 학습을 가속화하기 위해.
  • 대화 기반 정보 검색 기법이 텍스트 어드벤처 환경에서 RL 에이전트의 성능과 샘플 효율성에 미치는 영향을 평가하기 위해.

제안 방법

  • 구조화된 질문을 사용해 게임 내 NPC와 상호작용하는 대화 에이전트로 미세조정된 LLM을 사용하여 게임 관련 지식을 추출한다.
  • LLM의 대화 응답에서 에이전트 중심 행동(주어가 '당신'인 것들)을 필터링하여 목표의 사전 조건을 나타내는 타겟 지식 그래프(KG)를 구축한다.
  • 내부 지식 그래프와 타겟 지식 그래프 간의 겹침을 기반으로 보조 보상 신호를 제공함으로써 스토리 형식의 구조를 적용한다.
  • 환경의 희박한 보상과 함께 지식 그래프 기반 보상 신호를 사용하여 KGA2C 에이전트를 훈련시켜 정책 학습을 이끈다.
  • LIGHT 프레임워크를 사용하여 승리 조건과 구조화된 게임 상태를 갖춘 맞춤형 텍스트 어드벤처 게임을 생성한다.
  • 100,000단계 동안의 훈련 동안 정기적인 간격으로 50개의 에피소드 평균 테스트 점수를 사용해 성능을 평가한다.

실험 결과

연구 질문

  • RQ1LLM 기반의 NPC와의 대화가 안정적으로 핵심 게임 지식을 추출하여 RL 에이전트 훈련을 가속화할 수 있는가?
  • RQ2NPC 대화의 지식 그래프 표현 방식이 RL 에이전트가 최적의 정책으로 향하도록 이끄는 데 얼마나 효과적인가?
  • RQ3LLM에서 유도된 지식 그래프를 활용한 스토리 형식의 구조가 RL 수렴을 위해 필요한 훈련 단계 수를 얼마나 줄일 수 있는가?
  • RQ4대화 기반 지식 검색 방법이 표준 RL 에이전트에 비해 샘플 효율성과 성능 일관성 면에서 뛰어나게 작용하는가?

주요 결과

  • Game 1에서 LLM에서 유도된 지식 그래프를 사용한 스토리 형식의 구조 에이전트는 약 10,000단계의 훈련 단계 내에 최적의 정책에 수렴한 반면, 기준선 에이전트는 약 90,000단계가 소요되었다.
  • 모든 훈련 단계 동안 스토리 형식의 구조 에이전트의 평균 테스트 점수가 기준선을 일관되게 뛰어넘었으며, 표준편차 범위가 겹치지 않았다.
  • 이 방법은 필요한 훈련 단계 수를 80% 이상 감소시켜 샘플 효율성 향상에 있어 뚜렷한 개선 효과를 보였다.
  • LLM 대화 에이전트는 구조화된 질문 템플릿을 사용할 경우 최소한의 환상(홀로지)을 동반하여 정확한 게임 정보, 즉 물체 간 의존성과 목표 사전 조건을 성공적으로 회수하였다.
  • 대화에서 유도된 타겟 지식 그래프는 RL 에이전트가 최적의 정책으로 향하도록 이끄는 신뢰할 수 있고 효과적인 보조 보상 신호를 제공하였다.
  • 이 프레임워크는 다양한 텍스트 기반 게임에서 뛰어난 성능을 보이며, 평가된 모든 환경에서 일관된 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.