Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Surrogate Assisted Generation of Environments

Varun Bhatt, Bryon Tjanaka|arXiv (Cornell University)|2022. 06. 09.
Advanced Multi-Objective Optimization Algorithms인용 수 11
한 줄 요약

이 논문은 새로운 환경에서 에이전트 행동을 예측하기 위해 딥 서rogate 모델을 사용하는 샘플 효율적인 질적 다양성(QD) 알고리즘인 DSAGE를 제안한다. 이는 다양하고 고성능의 환경을 발견하는 데 있어 상당한 가속화를 이룬다. 두 가지 벤치마크 도메인인 미로와 마리오에서 DSAGE는 강화학습 및 계획 에이전트 모두가 다양한 행동을 보이도록 유도하는 환경 생성에서 최신 기술을 능가한다. 아울러 정밀 분석을 통해 보조 행동 데이터와 아카이브 다운샘플링을 통해 성능 향상이 이루어졌음을 확인하였다.

ABSTRACT

Recent progress in reinforcement learning (RL) has started producing generally capable agents that can solve a distribution of complex environments. These agents are typically tested on fixed, human-authored environments. On the other hand, quality diversity (QD) optimization has been proven to be an effective component of environment generation algorithms, which can generate collections of high-quality environments that are diverse in the resulting agent behaviors. However, these algorithms require potentially expensive simulations of agents on newly generated environments. We propose Deep Surrogate Assisted Generation of Environments (DSAGE), a sample-efficient QD environment generation algorithm that maintains a deep surrogate model for predicting agent behaviors in new environments. Results in two benchmark domains show that DSAGE significantly outperforms existing QD environment generation algorithms in discovering collections of environments that elicit diverse behaviors of a state-of-the-art RL agent and a planning agent. Our source code and videos are available at https://dsagepaper.github.io/.

연구 동기 및 목표

  • 다양한 환경에서 다양한 에이전트 행동을 생성하는 데 있어 질적 다양성(QD) 알고리즘의 높은 샘플 비용 문제를 해결하기 위해.
  • 전체 시뮬레이션 없이도 에이전트 성능을 예측할 수 있는 딥 서rogate 모델을 활용하여 환경 생성의 샘플 효율성을 향상시키기 위해.
  • 이전 실행 트레이스를 바탕으로 다양한 에이전트 행동을 유도하는 스케일러블하고 상호작용 가능한 테스트 세트를 제공하기 위해.
  • 서rogate 보조 QD가 기존 QD 방법보다 행동적으로 다양한 환경을 더 효과적으로 발견할 수 있는지 입증하기 위해.

제안 방법

  • DSAGE는 시뮬레이션된 에이전트 트레이제터리에 기반해 훈련된 딥 서rogate 모델을 통합하여, 새로운 미리보지 않은 환경에서의 에이전트 행동을 예측한다.
  • 알고리즘은 서rogate 모델의 예측에 따라 행동 공간을 탐색하는 QD 최적화기(예: CMA-ME)를 사용한다.
  • 서rogate 예측 아카이브에서 상위 성능을 보인 후보 환경의 일부가 다운샘플링을 통해 선택되며, 이는 전체 시뮬레이션을 통해 평가된다.
  • 최신 수집된 시뮬레이션 데이터를 사용해 서rogate 모델을 피지컬 튜닝함으로써 반복적 개선이 가능하고, 고비용 시뮬레이션에 대한 의존도를 감소시킨다.
  • 예를 들어 경로 길이, 반복 방문 수와 같은 보조 행동 데이터를 사용해 서rogate 모델의 예측 정확도와 일반화 능력을 향상시킨다.
  • 이 방법은 두 가지 벤치마크 도메인에 적용되었으며, ACCEL 강화학습 에이전트가 사용된 미로 도메인과 A* 계획 에이전트가 사용된 마리오 도메인이다.

실험 결과

연구 질문

  • RQ1딥 서rogate 모델이 QD 최적화에서 다양한 환경을 생성하기 위해 필요한 고비용 에이전트 시뮬레이션 수를 상당히 줄일 수 있는가?
  • RQ2보조 행동 데이터를 통합함으로써 서rogate 모델의 환경 생성 성능이 어떻게 향상되는가?
  • RQ3서rogate 예측 아카이브에서의 다운샘플링이 모든 후보를 직접 시뮬레이션하는 것보다 더 높은 행동 다양성을 이끌어내는가?
  • RQ4다양한 도메인에서 DSAGE가 최신 기술 QD 알고리즘과 비교해 행동적으로 다양한 에이전트 행동을 발견하는 데 얼마나 효과적인가?
  • RQ5서rogate 보조 QD가 급격히 변화하는 행동을 보이는 복잡하고 확률적인 환경에 효과적으로 스케일링될 수 있는가?

주요 결과

  • DSAGE는 미로 및 마리오 벤치마크 도메인에서 최신 기술 QD 알고리즘을 능가하여 다양한 에이전트 행동을 발견하는 데 성공했다.
  • 미로 도메인에서 DSAGE는 더 적은 전체 시뮬레이션 수로도 미로 탐색 및 반복 방문 등의 측정 기준에서 더 높은 행동 다양성을 달성했다.
  • 마리오 도메인에서 DSAGE는 점프 빈도 및 적 처치 수 등 더 넓은 범위의 행동을 이끌어내는 레벨을 생성했으며, 기준 QD 방법보다 뛰어난 성능을 보였다.
  • 아우터레이션 연구를 통해 보조 행동 데이터 사용 및 다운샘플링이 서rogate 모델 성능 향상에 기여하여 행동 공간의 더 나은 커버리지가 이루어졌음을 확인하였다.
  • 서rogate 모델은 요구되는 전체 시뮬레이션 수를 상당히 감소시켰으며, DSAGE는 전통적인 QD 접근 방식에 비해 훨씬 적은 샘플 수로도 고성능 결과를 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.