Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Reinforcement Learning with Wasserstein Constraint

Linfang Hou, Liang Pang|arXiv (Cornell University)|2020. 06. 01.
Adversarial Robustness in Machine Learning참고 문헌 26인용 수 11
한 줄 요약

이 논문은 기준 전이 커널 주위의 워샤프스키 볼을 통해 환경 동역학의 불확실성을 모델링하는 워샤프스키 제약을 갖춘 강화학습 프레임워크를 제안한다. 이는 무한차원의 강건 MDP 문제를 유한차원의 위험 인지 문제로 변환한다. 워샤프스키 거리의 강력한 이중성 덕분에 전이 커널의 변동과 상태 수준의 외란 간의 연결 고리를 구축함으로써, 환경에 대한 사전 지식이 필요 없는 이론적으로 타당한 강건성을 확보한 새로운 WRAAC 알고리즘을 설계할 수 있게 되었으며, Cart-Pole 환경에서의 동적 외란 하에서 향상된 성능을 통해 검증되었다.

ABSTRACT

Robust Reinforcement Learning aims to find the optimal policy with some extent of robustness to environmental dynamics. Existing learning algorithms usually enable the robustness through disturbing the current state or simulating environmental parameters in a heuristic way, which lack quantified robustness to the system dynamics (i.e. transition probability). To overcome this issue, we leverage Wasserstein distance to measure the disturbance to the reference transition kernel. With Wasserstein distance, we are able to connect transition kernel disturbance to the state disturbance, i.e. reduce an infinite-dimensional optimization problem to a finite-dimensional risk-aware problem. Through the derived risk-aware optimal Bellman equation, we show the existence of optimal robust policies, provide a sensitivity analysis for the perturbations, and then design a novel robust learning algorithm--Wasserstein Robust Advantage Actor-Critic algorithm (WRAAC). The effectiveness of the proposed algorithm is verified in the Cart-Pole environment.

연구 동기 및 목표

  • 상태나 파라미터를 흔들어가며 적용하는 히وري스틱 강건 RL 방법들에서 이론적인 강건성 보장을 부족하게 하는 문제를 해결한다.
  • 워샤프스키 거리를 사용하여 전이 확률 동역학에 대한 강건성을 정량화하는 원칙적인 프레임워크를 개발한다.
  • 강력한 이중성 덕분에 무한차원의 강건 MDP 문제를 해석 가능한 유한차원의 위험 인지 MDP 문제로 변환한다.
  • 환경에 대한 사전 지식이 필요 없는 데이터 기반, 환경에 관계없는 강건 RL 알고리즘을 설계한다.
  • Cart-Pole 환경에서 실제 세계 유사한 동적 외란 상황에서 제안된 방법의 효과성과 강건성을 입증한다.

제안 방법

  • 기준 전이 커널 중심의 워샤프스키 기반 불확실성 집합을 정의하여 허용 가능한 동역학 외상의 범위를 제약한다.
  • 워샤프스키 거리의 강력한 이중성을 적용하여 강건 MDP 문제를 위험 인지 MDP 문제로 재구성하고, 전이 커널 외상과 상태 수준의 외란 간의 연결 고리를 맺는다.
  • 이론적 분석이 가능한 조정된 강건 벨먼 방정식을 유도하여 최적 정책과 외상에 대한 민감도를 분석한다.
  • 위험 인지 이점 추정을 사용하여 가치 함수와 정책 갱신을 번갈아 수행하는 이중 단계의 액터-크리틱 방법인 WRAAC 알고리즘을 제안한다.
  • 이중 변수 학습 메커니즘을 사용하여 워샤프스키 제약 조건을 추정하며, 각 상태 전이에 대해 λ와 z는 시뮬레이션된 동역학에 기반해 초기화된다.
  • 값 네트워크와 정책 네트워크에 별도의 학습률을 사용하여 스토하스틱 그래디언트 업데이트를 통해 정책을 종합적으로 학습시킨다.

실험 결과

연구 질문

  • RQ1강화학습에서 전이 확률 동역학에 대한 강건성을 공식적으로 정량화하는 데 워샤프스키 거리를 사용할 수 있는가?
  • RQ2이중성의 원리를 통해 어떻게 무한차원의 강건 MDP 문제를 해석 가능한 유한차원 위험 인지 MDP 문제로 축소할 수 있는가?
  • RQ3제안된 방법은 시스템 파라미터의 사전 지식 없이도 환경의 동적 변화에 대해 강건성을 확보할 수 있는가?
  • RQ4워샤프스키 불확실성 집합의 반경 δ에 대해 최적 정책의 민감도는 어떠한가?
  • RQ5WRAAC 알고리즘은 실제 세계 유사 환경에서의 동적 외란 상황에서 표준 A2C보다 더 나은 일반화 성능을 보일 수 있는가?

주요 결과

  • WRAAC 알고리즘은 힘의 크기의 외상(예: 100 단위) 상황에서 표준 A2C보다 유의미하게 높은 강건성을 확보하며, 더 오래 폴대를 유지하는 데 성공했다.
  • 기준 A2C 정책은 작은 외상 상황에서는 WRAAC와 유사한 성능을 보이며, 이는 정상 조건 하에서 성능 저하 없이 강건성을 확보하고 있음을 시사한다.
  • 두 정책 모두 빠르게 악화되는 상황(예: 폴대 질량이 1.25를 초과할 경우)에서도 강건 정책은 안정적인 성능을 유지하며, 이는 선형 외상으로 쉽게 기록되지 않는 급격한 동적 변화를 반영한다.
  • 실험 결과는 WRAAC가 환경의 동적 변화에 대해 진정으로 강건한 학습을 이룬다는 것을 확인하며, 다양한 동적 조건에서 일관된 성능을 보였다.
  • 환경 파라미터의 선택(예: 힘의 크기 vs. 폴대 질량)은 외상의 부드러움에 큰 영향을 미치며, 힘의 크기 조건에서 더 예측 가능한 강건성 평가가 가능하다.
  • WRAAC 알고리즘은 환경에 대한 명시적 특성 기반 또는 사전 파라미터 지식 없이도 이론적·실험적 우수성을 입증하며 강건성을 확보한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.