Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Reinforcement Learning via Adversarial training with Langevin Dynamics

Parameswaran Kamalaruban, Yu‐Ting Huang|arXiv (Cornell University)|2020. 02. 14.
Reinforcement Learning in Robotics참고 문헌 37인용 수 12
한 줄 요약

이 논문은 환경적 요동에 저항하는 능력을 갖춘 강화학습 에이전트를 훈련하기 위해 Stochastic Gradient Langevin Dynamics (SGLD)를 사용하는 샘플링 기반의 강력한 강화학습 알고리즘을 제안한다. 순수 내쉬 균형 탐색이 아닌 혼합 내쉬 균형 문제로 강력한 강화학습을 재정의함으로써, MuJoCo 환경에서 예측할 수 없는 환경 변화에 대해 표준 정책 기반 강화학습 및 최적화 기반 기준선보다 뛰어난 일반화 성능을 달성한다. 이는 비강건 목표로 훈련된 경우에도 성립한다.

ABSTRACT

We introduce a sampling perspective to tackle the challenging task of training robust Reinforcement Learning (RL) agents. Leveraging the powerful Stochastic Gradient Langevin Dynamics, we present a novel, scalable two-player RL algorithm, which is a sampling variant of the two-player policy gradient method. Our algorithm consistently outperforms existing baselines, in terms of generalization across different training and testing conditions, on several MuJoCo environments. Our experiments also show that, even for objective functions that entirely ignore potential environmental shifts, our sampling approach remains highly robust in comparison to standard RL algorithms.

연구 동기 및 목표

  • 분포 이탈과 환경 불일치 상황에서 딥 강화학습 에이전트의 취약성을 해결하기 위해.
  • 비볼록-볼록 목표로 인해 의미 있는 균형에 수렴하지 못하는 경향이 있는 최적화 기반 방법의 한계를 극복하기 위해.
  • 특히 혼합 내쉬 균형에 기반한 샘플링 기반 접근법이 순수 정책 기반 강화학습에 비해 더 뛰어난 강건성과 일반화 성능을 제공함을 보여주기 위해.
  • 비강건 목표로 훈련된 샘플링 알고리즘이 최적화 기반 강력한 강화학습과 비교해도 성능이 유사하거나 뛰어나다는 것을 보여주기 위해.
  • SGLD 기반 샘플링이 역전운동자와 같은 실패 케이스에서 환경적 요동에 대해 효과적으로 대응할 수 있음을 검증하기 위해.

제안 방법

  • 강력한 강화학습을 두 명의 플레이어 간의 최소-최대 게임으로 설정하여, 주인공은 기대 수익을 최대화하고, 적대자는 교란을 도입한다.
  • 정책의 사후 분포에서 샘플링하기 위해 Stochastic Gradient Langevin Dynamics (SGLD)를 사용하여 혼합 내쉬 균형 탐색을 가능하게 한다.
  • 수렴성과 안정성을 향상시키기 위해 RMSProp 기반 적응형 학습률을 사용하는 전처리된 SGLD 변형을 적용한다.
  • 강력한 강화학습 목표를 혼합 전략 게임으로 간주함으로써, 비볼록-볼록 설정에서 순수 내쉬 균형 탐색의 단점을 피한다.
  • 동일한 훈련 조건에서 표준 및 강력한 강화학습 목표에 모두 샘플링 프레임워크를 적용하여 비교 가능성을 확보한다.
  • Langevin 동역학을 사용해 노이즈를 주입함으로써, TD3 및 SAC와 같은 오프-폴리시 알고리즘에 통합한다.

실험 결과

연구 질문

  • RQ1환경 변화 상황에서 샘플링 기반 방법이 최적화 기반 접근법보다 강력한 강화학습 에이전트 훈련에 더 나은 성능을 보일 수 있는가?
  • RQ2비볼록-볼록 강력한 강화학습 목표에서 혼합 내쉬 균형에서 샘플링하는 것이 순수 내쉬 균형 탐색보다 더 나은 일반화 성능을 제공하는가?
  • RQ3비강건 목표로 훈련된 샘플링 기반 알고리즘이 동일한 강건 목표로 훈련된 최적화 기반 기준선과 비교해도 성능이 유사하거나 뛰어나게 될 수 있는가?
  • RQ4SGLD 기반 샘플링 방법은 예측할 수 없는 마찰계수나 질량 변화 상황에서의 역전운동자 실패 케이스에서 어떻게 성능을 발휘하는가?
  • RQ5Langevin 동역학의 사용이 Walker, HalfCheetah, Hopper와 같은 연속 제어 과제에서 강건성을 얼마나 향상시키는가?

주요 결과

  • 제안된 샘플링 기반 알고리즘인 TD3 with MixedNE-LD는 예측할 수 없는 환경적 교란 상황에서 여러 MuJoCo 환경에서 표준 TD3 및 SAC보다 일관되게 뛰어난 성능을 보였다.
  • 비강건 목표로 훈련된 경우에도 샘플링 방법은 동일한 강건 목표로 훈련된 최적화 기반 강력한 강화학습 방법과 비교해 성능이 유사하거나 뛰어나게 달성했다.
  • 표준 정책 기반 강화학습 방법이 실패하는 경우, 예를 들어 질량 및 마찰계수 변화 상황에서의 역전운동자 문제를 성공적으로 처리했다.
  • 실험 결과, 샘플링 접근법이 예측할 수 없는 마찰계수, 질량, 노이즈 확률 값에 대해 잘 일반화됨을 확인했으며, 강건성의 우수성을 시사한다.
  • RMSProp 전처리된 SGLD 변형은 고차원 정책 공간에서 안정적인 훈련과 효과적인 탐색을 보였다.
  • 모든 평가 설정에서 5개의 랜덤 시드 모두에서 샘플링 기반 방법이 뛰어난 성능을 유지했으며, 이는 높은 재현성과 안정성을 나타낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.