Skip to main content
QUICK REVIEW

[논문 리뷰] Marathon Environments: Multi-Agent Continuous Control Benchmarks in a Modern Video Game Engine

Joe Booth, Jackson Booth|arXiv (Cornell University)|2019. 02. 25.
Human Pose and Action Recognition참고 문헌 9인용 수 6
한 줄 요약

이 논문은 Unity 게임 엔진을 사용하여 ML-Agents 툴킷을 활용해 개발된 다중 에이전트 연속 제어 벤치마크인 Marathon Environments를 소개한다. 이는 고급 딥 강화학습 정책—모션 캡처 데이터에서 유도된 걷기, 달리기, 역주퍼 등—이 상용 게임 엔진에서 효과적으로 학습될 수 있음을 보여주며, 최적화된 학습 전략을 통해 훈련 시간을 크게 단축시킬 수 있음을 입증한다.

ABSTRACT

Recent advances in deep reinforcement learning in the paradigm of locomotion using continuous control have raised the interest of game makers for the potential of digital actors using active ragdoll. Currently, the available options to develop these ideas are either researchers' limited codebase or proprietary closed systems. We present Marathon Environments, a suite of open source, continuous control benchmarks implemented on the Unity game engine, using the Unity ML- Agents Toolkit. We demonstrate through these benchmarks that continuous control research is transferable to a commercial game engine. Furthermore, we exhibit the robustness of these environments by reproducing advanced continuous control research, such as learning to walk, run and backflip from motion capture data; learning to navigate complex terrains; and by implementing a video game input control system. We show further robustness by training with alternative algorithms found in OpenAI.Baselines. Finally, we share strategies for significantly reducing the training time.

연구 동기 및 목표

  • 학술적 강화학습 연구와 실제 게임 엔진 구현 사이의 격차를 메우기 위해 접근 가능하고 오픈소스인 벤치마크를 제공하는 것.
  • 모의 환경에서 학습된 연속 제어 정책이 상용 게임 엔진(예: Unity)으로 안정적으로 이식될 수 있음을 입증하는 것.
  • 모션 캡처 데이터를 활용하여 복잡하고 동적인 환경에서 다중 에이전트 시스템을 훈련하기 위한 확장 가능하고 스케일러블 플랫폼을 제공하는 것.
  • 초기 설정 최적화 및 환경 설계를 통해 딥 강화학습 벤치마크의 샘플 및 시간 효율성을 크게 향상시키는 것.

제안 방법

  • 저자는 ML-Agents 툴킷을 사용하여 Unity 게임 엔진 내에서 다중 에이전트 훈련을 지원하는 연속 제어 환경의 세트를 구현하였다.
  • 모션 캡처 데이터를 시범 자료로 사용하여 걷기, 달리기, 역주퍼와 같은 복잡한 운동 행동을 지원하도록 환경를 설계하였다.
  • 인간과 유사한 제어 및 학습 정책 평가를 가능하게 하기 위해 비디오 게임 입력 제어 시스템을 통합하였다.
  • 다양한 강화학습 알고리즘을 지원하여 상호 알고리즘 검증 및 정책의 강건성 테스트를 가능하게 하였다.
  • 상태 정규화 및 보상 형상 조정을 포함한 환경 수준의 최적화 및 하이퍼파rameter 최적화를 통해 훈련 효율성을 향상시켰다.
  • 모션 캡처에서 유도된 복잡한 운동 기술을 포함한 최첨단 성능 결과를 재현함으로써 시스템을 검증하였다.

실험 결과

연구 질문

  • RQ1Unity와 같은 상용 게임 엔진에서 복잡한 운동 제어를 위한 딥 강화학습 정책을 성공적으로 학습시킬 수 있는가?
  • RQ2Marathon Environments에서 학습된 연속 제어 정책의 성능은 전통적인 연구 환경에서의 정책과 비교해 어떻게 되는가?
  • RQ3모션 캡처 데이터가 모의 다중 에이전트 환경에서 정책 학습을 유도하는 데 얼마나 효과적으로 활용될 수 있는가?
  • RQ4어떤 훈련 최적화 기법이 연속 제어 벤치마크에서 샘플 및 시간 효율성을 크게 향상시키는가?
  • RQ5동일한 환경이 다양한 알고리즘과 다중 에이전트 협업 작업을 모두 지원할 수 있는가?

주요 결과

  • Marathon Environments 프레임워크는 모션 캡처 데이터를 활용하여 걷기, 달리기, 역주퍼와 같은 복잡한 운동 행동의 학습을 성공적으로 가능하게 하였다.
  • 다양한 강화학습 알고리즘을 통해 학습된 정책들이 안정적인 성능을 보이며 강건성과 이식 가능성의 가능성을 입증하였다.
  • 비디오 게임 입력 시스템의 통합을 통해 직접적인 인간 평가 및 학습된 행동의 검증이 가능해졌다.
  • 환경 수준의 최적화 및 하이퍼파rameter 최적화를 통해 샘플 및 월클록 훈련 시간이 크게 단축되었다.
  • 프레임워크는 다중 에이전트 훈련 및 협업을 지원하여 단일 에이전트 작업을 넘어서도 확장 가능한 것을 확인하였다.
  • 벤치마크 세트의 오픈소스 성격 덕분에 연구 커뮤니티 전반에서 재현 및 확장이 가능해졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.