[논문 리뷰] Sample Factory: Egocentric 3D Control from Pixels at 100000 FPS with Asynchronous Reinforcement Learning
Sample Factory는 이방향, GPU 가속 샘플링과 비정책 보정을 사용하여 단일 머신에서 1초당 100,000 프레임 이상의 환경 프레임을 달성하는 고처리량 단일 머신 강화학습 시스템을 소개한다. 이는 다중 플레이어 도움(Doom) 환경에서 자기대전과 인구기반 학습을 통해 강력한 정책을 훈련시키는 데 성공했으며, 분산 클러스터에 의존하지 않고도 3D 환경에서 높은 수준의 에이전트를 효율적으로 훈련시킬 수 있음을 보여준다.
Increasing the scale of reinforcement learning experiments has allowed researchers to achieve unprecedented results in both training sophisticated agents for video games, and in sim-to-real transfer for robotics. Typically such experiments rely on large distributed systems and require expensive hardware setups, limiting wider access to this exciting area of research. In this work we aim to solve this problem by optimizing the efficiency and resource utilization of reinforcement learning algorithms instead of relying on distributed computation. We present the "Sample Factory", a high-throughput training system optimized for a single-machine setting. Our architecture combines a highly efficient, asynchronous, GPU-based sampler with off-policy correction techniques, allowing us to achieve throughput higher than $10^5$ environment frames/second on non-trivial control problems in 3D without sacrificing sample efficiency. We extend Sample Factory to support self-play and population-based training and apply these techniques to train highly capable agents for a multiplayer first-person shooter game. The source code is available at https://github.com/alex-petrenko/sample-factory
연구 동기 및 목표
- 딥 강화학습에서 대규모 분산 시스템에 대한 의존도를 줄이기 위해 단일 머신의 처리량을 최적화하는 것.
- 복잡한 3D 제어 작업을 위한 일반 하드웨어에서 높은 샘플 효율성과 훈련 처리량을 달성하는 것.
- 단일 노드 설정을 사용하여 다중 에이전트 환경에서 확장 가능한 인구기반 및 자기대전 훈련을 가능하게 하는 것.
- 단일 머신에서 극도로 높은 처리량을 달성할 경우 대규모 분산 시스템의 결과를 따라하거나 초월할 수 있음을 보여주는 것.
제안 방법
- 시스템은 여러 환경 인스턴스를 통해 병렬로 동작을 생성하고 환경 전이를 수집하는 이방향, GPU 기반 샘플러를 사용한다.
- 비정책 보정 기법을 적용하여 이방향 데이터 수집에도 불구하고 샘플 효율성을 유지한다.
- 비동기 프록시 페리클 정책 최적화(APPO)를 중심으로 한 아키텍처를 구축하여 경험의 미니배치를 사용한 효율적인 기울기 갱신을 가능하게 한다.
- 중앙 집중형 학습자 컴ponent가 여러 액터로부터 기울기를 집계하고 비동기적으로 정책 모델을 갱신한다.
- 승률을 기반으로 성능이 열악한 에이전트를 재초기화하고 하이퍼파ram터를 동적으로 변형함으로써 자기대전과 인구기반 훈련을 지원한다.
- 단일 GPU에서 배치 추론을 활용하여 처리량을 극대화하였으며, 36코어, 4GPU 서버에서 최대 130,000 FPS를 달성했다.
실험 결과
연구 질문
- RQ1단일 머신 강화학습 시스템이 3D 제어 작업에서 100,000 프레임 이상의 처리량을 초과할 수 있는가?
- RQ2고처리량 이방향 샘플링과 결합된 비정책 보정 기법이 샘플 효율성을 유지할 수 있는가?
- RQ3분산 인프라 없이도 자기대전과 인구기반 훈련이 단일 머신에서 효과적으로 확장될 수 있는가?
- RQ4고처리량 단일 머신 훈련이 스크립트된 상대를 상대로 훈련된 에이전트보다 일반화 능력이 뛰어난 정책을 생성하는가?
- RQ5이러한 시스템은 복잡하고 전략적인 3D 다중 플레이어 게임인 도움에서 높은 수준의 경쟁이 가능한 에이전트를 훈련시킬 수 있는가?
주요 결과
- Sample Factory는 단일 36코어, 4GPU 서버에서 최고 처리량 130,000 환경 프레임/초를 기록하였으며, 평가된 모든 3D 환경에서 100,000 FPS를 초과했다.
- 스크립트된 보트 상대를 상대로 훈련한 에이전트는 100% 승리를 거두었지만, 상대 유형에 과적합되어 뚜렷한 강건성 결여를 보였다.
- 자기대전 훈련에서 인구기반 접근법은 다양한 전략 세트를 생성했으며, 최종 에이전트는 스크립트 보트를 상대로 100경기 중 78경기에서 승리했다.
- 자기대전 에이전트는 스크립트 보트를 상대로 78승, 19무, 3패를 기록하여 더 뛰어난 일반화 능력과 강건성을 보였다.
- 시스템은 단일 서버에서 1v1 도움 환경에서 8명의 에이전트를 각각 25억 프레임씩 훈련시켰으며, 약 18년 분량의 시뮬레이션 경험을 소비했다.
- 높은 성능에도 불구하고 에이전트들은 여전히 전문 인간 플레이어에 뒤지며, 청각 인식 및 다중 감각 통합의 부재로 인해 한계를 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.