Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Interactive Training of Non-Player Characters in Video Games

Igor Borovikov, Jesse Harder|arXiv (Cornell University)|2019. 06. 03.
Digital Games and Media참고 문헌 16인용 수 13
한 줄 요약

이 논문은 비디오 게임 내 비플레이어 캐릭터(NPC)를 훈련시키기 위해 인간이 참여하는 인터랙티브 이mitation 학습 프레임워크를 제안한다. 행동 이력을 포함한 확장된 상태를 갖춘 다중 해상도 앙상블 마르코프 모델을 사용함으로써, 최소한의 인간 노력으로 높은 성능의 NPC 행동을 달성하며, 1분 미만의 인터랙티브 훈련으로 체육관 환경과 1인칭 슈팅 게임 모두에서 효과적인 기술 습득을 입증한다.

ABSTRACT

There is a high demand for high-quality Non-Player Characters (NPCs) in video games. Hand-crafting their behavior is a labor intensive and error prone engineering process with limited controls exposed to the game designers. We propose to create such NPC behaviors interactively by training an agent in the target environment using imitation learning with a human in the loop. While traditional behavior cloning may fall short of achieving the desired performance, we show that interactivity can substantially improve it with a modest amount of human efforts. The model we train is a multi-resolution ensemble of Markov models, which can be used as is or can be further "compressed" into a more compact model for inference on consumer devices. We illustrate our approach on an example in OpenAI Gym, where a human can help to quickly train an agent with only a handful of interactive demonstrations. We also outline our experiments with NPC training for a first-person shooter game currently in development.

연구 동기 및 목표

  • 비디오 게임에서 수작업으로 만든 NPC 행동의 확장성과 현실성의 한계를 해결하기 위해.
  • 게임 디자이너가 최소한의 간섭으로 인간처럼 행동하는 고품질의 NPC를 인터랙티브 디모니스트레이션을 통해 훈련시킬 수 있도록 하기 위해.
  • 행동 이력과 양자화된 상태 표현을 통합함으로써 이mitation 학습의 일반화 능력과 스타일 충실도를 향상시키기 위해.
  • 소비자 하드웨어에서 배포 가능한 가벼운 실시간 호환 모델을 개발하기 위해.
  • 복잡한 오픈 월드 게임 환경에서의 인터랙티브 훈련의 가능성을 입증하기 위해.

제안 방법

  • 이 방법은 인간의 디모니스트레이션을 기반으로 훈련된 다중 해상도 마르코프 모델 앙상블을 사용하여 계층적이고 스타일적인 행동을 포착한다.
  • 최근 행동 이력(최대 n단계)과 현재 관측값을 조합하여 확장된 상태를 구성함으로써, 모델이 인간처럼 행동하는 스타일을 유지하는 능력을 향상시킨다.
  • 상태 공간과 행동 공간의 양자화는 제한된 디모니스트레이션에서도 일반화를 가능하게 하며, 모델 복잡도를 감소시키고 추론 속도를 향상시킨다.
  • 모델은 인간이 참여하는 반복적 훈련 방식으로 훈련되며, 에이전트가 실패할 경우 디자이너가 제어를 맡아 수정 디모니스트레이션을 제공한다.
  • 실시간 게임 환경에서의 배포를 위해 DAGGER 또는 부트스트랩 기반 데이터 생성을 통한 모델 압축을 지원한다.
  • 게임 상태 특징은 상대적이고 의미 있는 표현(예: 상대적 위치, 시야, 체력, 탄약 수)으로 변환되어 학습 효율성이 향상된다.

실험 결과

연구 질문

  • RQ1표준 행동 클로닝에 비해 인간이 참여하는 인터랙티브 이mitation 학습이 NPC 행동 품질을 상당히 향상시킬 수 있는가?
  • RQ2행동 이력을 포함한 확장된 상태의 사용이 인간 플레이의 스타일적 요소를 얼마나 효과적으로 유지하는가?
  • RQ3소량의 인터랙티브 디모니스트레이션으로부터 다중 해상도 마르코프 모델이 얼마나 잘 일반화되는가?
  • RQ4이 방법을 사용해 복잡한 오픈 월드 1인칭 슈팅 게임에서 기민하고 실시간 반응이 가능한 NPC를 훈련시킬 수 있는가?
  • RQ5모델 성능이 증가하는 인터랙티브 디모니스트레이션 수와 다양한 양자화 방식에 따라 어떻게 변화하는가?

주요 결과

  • 로열 랜더 환경에서, 몇 차례의 인터랙티브 디모니스트레이션 후 랜덤 에이전트보다 상당히 뛰어난 성능을 기록했으며, 최소한 한 에피소드는 완전히 해결되었다.
  • 마르코프 앙상블 모델은 인간의 상호작용 40초 만에 1인칭 슈팅 게임에서 공격적인 행동 패턴을 학습하여 하드코딩된 백업 로직이 필요 없어졌다.
  • 모델의 추론 효율성은 유지되었으며, 로딩 및 추론 시간이 디모니스트레이션 수에 비례하여 선형적으로 증가하여 실시간 사용이 가능했다.
  • 상태 및 행동 공간의 양자화로 인해 제한된 훈련 데이터에도 불구하고 효과적인 일반화가 가능했으며, 예측 불가능한 상태에서도 강건성이 향상되었다.
  • 심지어 열악한 인간 디모니스트레이션이라도 랜덤 정책보다 훨씬 뛰어난 성능을 보였으며, 특히 인터랙티브 수정과 조합했을 때 두드러졌다.
  • DAGGER 또는 합성 데이터 생성을 통한 모델 압축을 지원하여, 소비자 수준의 하드웨어에서도 작고 고성능의 모델을 배포할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.