Skip to main content
QUICK REVIEW

[논문 리뷰] Using Unity to Help Solve Intelligence

Tom Ward, Andrew Bolt|arXiv (Cornell University)|2020. 11. 18.
Reinforcement Learning in Robotics참고 문헌 30인용 수 6
한 줄 요약

이 논문은 기존 플랫폼의 제한을 극복하기 위해 유니티(Unity)라는 일반 목적의 게임 엔진을 사용하여 다양하고 복잡한 강화학습 환경을 구축하기 위한 프레임워크를 제시한다. 표준화된 통신 프rotocol와 재현 가능한 패키징 방법을 개발함으로써, 저자들은 다양한 인공지능 연구 과제를 지원하는 효율적이고 재사용 가능하며 확장 가능한 시뮬레이션 환경을 구현하였다. 이는 여러 개의 출판된 논문에서의 활용을 통해 입증되었다.

ABSTRACT

In the pursuit of artificial general intelligence, our most significant measurement of progress is an agent's ability to achieve goals in a wide range of environments. Existing platforms for constructing such environments are typically constrained by the technologies they are founded on, and are therefore only able to provide a subset of scenarios necessary to evaluate progress. To overcome these shortcomings, we present our use of Unity, a widely recognized and comprehensive game engine, to create more diverse, complex, virtual simulations. We describe the concepts and components developed to simplify the authoring of these environments, intended for use predominantly in the field of reinforcement learning. We also introduce a practical approach to packaging and re-distributing environments in a way that attempts to improve the robustness and reproducibility of experiment results. To illustrate the versatility of our use of Unity compared to other solutions, we highlight environments already created using our approach from published papers. We hope that others can draw inspiration from how we adapted Unity to our needs, and anticipate increasingly varied and complex environments to emerge from our approach as familiarity grows.

연구 동기 및 목표

  • 기존 강화학습 플랫폼의 제약을 해결하기 위해, 기반 게임 엔진에 의존하고 환경 설계의 다양성이 부족한 플랫폼의 한계를 해결한다.
  • 일반 지능 평가를 위한 복잡하고 시각적으로 풍부하며 계산적으로 효율적인 가상 환경의 구축을 가능하게 한다.
  • 모든 종속 항목을 포함한 표준화된 패키징 방법을 도입함으로써 강화학습 연구의 재현 가능성을 향상시킨다.
  • 유니티가 다양한 종류의 1인칭, 3차원, 프로시저럴 환경을 위한 강화학습 기반 플랫폼으로서의 유연성과 확장성을 어떻게 입증하는지 보여준다.
  • 외부 에이전트와 유니티 기반 환경 간의 원활한 통합을 가능하게 하는 재사용 가능한 오픈 프로토콜 통신 시스템을 제공한다.

제안 방법

  • 높은 시각적 정확도와 시뮬레이션 정밀도를 갖춘 다양한 강화학습 환경를 제작하기 위해 유니티 게임 엔진을 융통성 있는 플랫폼으로 활용한다.
  • 외부 에이전트와 유니티 환경를 연결하기 위한 커스터마이즈된 오픈소스 통신 프로토콜을 설계하여 실시간 관측 및 동작 교환을 가능하게 한다.
  • 모든 필수 종속 항목을 함께 패키징하는 표준화된 패키징 방법을 구현하여 다양한 시스템 간의 재현 가능성을 확보한다.
  • 프로그래머 우호적인 도구와 활발한 커뮤니티를 활용하여 환경 개발의 간소화와 엔지니어링 오버헤드 감소를 이룬다.
  • 프로시저럴 생성 기법을 사용하여 환경 간에 다이나믹하고 다양해진 초기 조건을 생성함으로써 일반화 테스트의 질을 향상시킨다.
  • 다양한 출판된 강화학습 연구와의 통합을 통해 프레임워크의 호환성과 대규모 환경에서의 성능을 검증한다.

실험 결과

연구 질문

  • RQ1기존 게임 기반 플랫폼의 제약을 초월하여, 유니티가 다양한 강화학습 환경 제작을 위한 확장 가능하고 융통성 있는 플랫폼으로 효과적으로 활용될 수 있는가?
  • RQ2표준화된 패키징과 종속 항목 관리 방법을 통해 강화학습 연구에서 환경의 재현 가능성과 배포 방식을 어떻게 향상시킬 수 있는가?
  • RQ3유니티 기반 환경가 일반 지능 평가에 요구되는 복잡한 물리 기반 및 메모리 집약적 강화학습 과제를 얼마나 잘 지원할 수 있는가?
  • RQ4통합된 통신 프로토콜을 사용할 경우, 다양한 유니티 환경과 에이전트 간의 상호운용성이 어떻게 향상되는가?
  • RQ5대규모 강화학습 훈련 및 평가를 위해 여러 동시 실행되는 유니티 인스턴스를 CPU 또는 GPU에서 실행할 경우의 계산 효율성은 어떠한가?

주요 결과

  • 프레임워크는 13개의 다양한 1인칭 3차원 환경을 성공적으로 생성하여 출판된 강화학습 연구에 활용하였다. 이는 기억, 탐색, 물리적 구조물 건설 등의 과제를 포함한다.
  • 포튜나토 등(2019)의 연구에서 13개 환경 중 8개가 제안된 유니티 기반 접근법을 사용하여 제작되었으며, 이는 복잡하고 메모리 집약적인 과제에 대한 적용 가능성을 입증한다.
  • 그레고르 등(2019)의 랜덤 시티(Random City) 및 볼록 환경(Voxel Environment)은 프로시저럴로 생성된 3차원 세계로, 믿음 상태 모델링 및 블록 조작 과제를 지원하였다.
  • 페인 등(2019)의 8개의 어려운 탐색 과제 세트는 이 프레임워크를 기반으로 제작되었으며, 매우 다양하게 변하는 초기 조건을 가지며 장기 계획이 필요한 과제였다.
  • 밥스트 등(2019)의 2차원 구조물 제작 환경는 연속적인 물리 기반 시뮬레이션을 사용하여 에이전트가 블록으로 구조물을 건설할 수 있는 능력을 테스트하였으며, 과제 성공 여부 또는 충돌 발생 시 에피소드 종료 기준으로 설정되었다.
  • 프레임워크는 CPU 또는 GPU에서 여러 동시 실행되는 유니티 인스턴스를 지원할 수 있을 정도로 충분한 계산 효율성을 확보하여 확장 가능한 훈련 및 평가를 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.