Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Reinforcement Learning using Adversarial Populations

Eugene Vinitsky, Yuqing Du|arXiv (Cornell University)|2020. 08. 04.
Adversarial Robustness in Machine Learning참고 문헌 30인용 수 13
한 줄 요약

이 논문은 각 롤아웃 동안 무작위로 초기화된 적대자 집단과 함께 강화학습 에이전트를 훈련시어 동적 교란에 대한 강건성을 크게 향상시키는 Robustness via Adversary Populations (RAP)를 제안한다. 단일 적대자 접근 방식은 새로운 교란 조건에서 실패하는 반면, RAP는 다양한 적대적 역학을 통해 에이전트를 노출시켜 일반화 능력을 향상시키며, 전문가가 조정한 불확실성 집합이 필요 없이 도메인 랜덤화보다 더 뛰어난 강건성을 달성한다.

ABSTRACT

Reinforcement Learning (RL) is an effective tool for controller design but can struggle with issues of robustness, failing catastrophically when the underlying system dynamics are perturbed. The Robust RL formulation tackles this by adding worst-case adversarial noise to the dynamics and constructing the noise distribution as the solution to a zero-sum minimax game. However, existing work on learning solutions to the Robust RL formulation has primarily focused on training a single RL agent against a single adversary. In this work, we demonstrate that using a single adversary does not consistently yield robustness to dynamics variations under standard parametrizations of the adversary; the resulting policy is highly exploitable by new adversaries. We propose a population-based augmentation to the Robust RL formulation in which we randomly initialize a population of adversaries and sample from the population uniformly during training. We empirically validate across robotics benchmarks that the use of an adversarial population results in a more robust policy that also improves out-of-distribution generalization. Finally, we demonstrate that this approach provides comparable robustness and generalization as domain randomization on these benchmarks while avoiding a ubiquitous domain randomization failure mode.

연구 동기 및 목표

  • 단일 적대자 강건 RL의 한계를 해결하기 위해, 표준 정책 파arametrization 하에서 새로운 적대적 교란 조건에 일반화하지 못하는 문제를 다루기 위해.
  • 적대자 집단이 혼합 네시 균형을 더 잘 근사하고 연속 제어 과제에서 강건성을 향상시키는지 조사하기 위해.
  • 특히 도메인 랜덤화의 일반적인 실패 모드를 피하는 데서 RAP의 강건성 및 일반화 성능을 도메인 랜덤화와 비교하기 위해.
  • 수동으로 설계된 도메인 랜덤화의 더 스케일러블하고 자동화된 대안으로서 적대자 집단이 사용될 수 있는지 탐색하기 위해.
  • 모ulative 시뮬레이션 로봇 벤치마크에서 적대자 집단 크기, 훈련 안정성, 정책 강건성 간의 상호 상충 관계를 이해하기 위해.

제안 방법

  • 이 방법은 각 훈련 롤아웃마다 독립적으로 초기화되고 균일하게 샘플링되는 확률적 적대자 집단을 도입한다.
  • 훈련 중에 에이전트는 집단에서 추출된 악성 교란 조건에 대해 가장 열악한 상황에서도 기대 수익을 최대화하는 정책을 학습한다.
  • 에이전트와 함께 적대자 집단은 최소화-최대화 프레임워크에서 함께 훈련되며, 에이전트는 성능을 최대화하고 각 적대자는 성능을 최소화하려 한다.
  • 이 방법은 표준 딥 강화학습 알고리즘(예: SAC)을 사용하며, 다수의 적대적 역학 샘플을 포함하는 공통 배치의 환경 상호작용을 활용한다.
  • 적대자 정책은 확률적 정책(예: 가우시안)으로 표현되며, 다양하고 도전적인 교란 조건을 생성하기 위해 정책 기반 강화 학습 방법으로 훈련된다.
  • 이 방법은 집단 기반 훈련을 통해 적대적 분포를 종단에서 학습함으로써 전문가가 정의한 불확실성 집합이 필요 없도록 한다.

실험 결과

연구 질문

  • RQ1단일 적대자를 사용할 경우 다양한 역학 변화에서 RL 정책의 강건성이 일관되게 향상되는가?
  • RQ2단일 적대자보다 적대자 집단이 혼합 네시 균형을 더 잘 근사할 수 있는가?
  • RQ3적대자 집단의 크기가 정책 강건성과 훈련 안정성에 어떤 영향을 미치는가?
  • RQ4전문가가 조정한 불확실성 분포가 필요 없이 RAP가 분포 외 설정에서 도메인 랜덤화보다 더 잘 일반화되는가?
  • RQ5RAP의 강건성은 혼합 전략의 더 나은 근사 때문인가, 아니면 적대적 도전의 더 높은 다양성 때문인가?

주요 결과

  • RAP는 테스트된 모든 MuJoCo 환경에서 강건성을 향상시키며, Hopper와 다른 도메인에서 세 명과 다섯 명의 적대자 집단이 최고의 성능을 기록한다.
  • 단일 적대자 접근 방식은 새로운 적대자에 대해 일반화하지 못하며, 새로운 교란 패턴에 노출되었을 때 정책이 악용될 수 있음을 보여준다.
  • 적대자 집단 크기가 세 명 이하일 때까지 강건성이 단조롭게 증가하며, 이후 성능이 정점에 도달하거나 약간 감소함으로써 다양성과 훈련 효율성 사이의 상충 관계가 있음을 시사한다.
  • 전문가가 조정한 불확실성 분포를 조정할 필요 없이 RAP는 도메인 랜덤화와 유사하거나 더 뛰어난 강건성을 달성하며, 도메인 랜덤화의 일반적인 실패 모드를 피한다.
  • 이 방법은 분포 외 일반화 능력이 향상되었으며, RAP로 훈련된 정책은 훈련 중에 볼 수 없었던 새로운 동적 교란 조건에서도 성능을 유지한다.
  • 적대자 집단을 사용할 경우, 정책은 더 적게 악용되며, 일관된 방향성 힘(예: 북쪽 또는 남쪽에서 오는 바람)에 더 강건하게 작동한다. 반면 단일 적대자 정책은 고정된 패턴에 적응하여 약화된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.