[논문 리뷰] Distributional Robustness and Regularization in Reinforcement Learning
이 논문은 워샤프스키 분포로 인한 강화학습과 정규화 사이의 이중 관계를 제안함으로써, 유한 샘플의 분포 외 성능 보장을 제공하는 워샤프스키 분포로 인한 강화학습 MDP를 수립한다. 새로운 정규화 기법이 경험적 가치 함수에 적용되어 강화학습에서 외부 불확실성에 대한 실용적 안정성을 보장하며, 이는 이론적 일반화 보장을 수반한다.
Distributionally Robust Optimization (DRO) has enabled to prove the equivalence between robustness and regularization in classification and regression, thus providing an analytical reason why regularization generalizes well in statistical learning. Although DRO's extension to sequential decision-making overcomes $ extit{external uncertainty}$ through the robust Markov Decision Process (MDP) setting, the resulting formulation is hard to solve, especially on large domains. On the other hand, existing regularization methods in reinforcement learning only address $ extit{internal uncertainty}$ due to stochasticity. Our study aims to facilitate robust reinforcement learning by establishing a dual relation between robust MDPs and regularization. We introduce Wasserstein distributionally robust MDPs and prove that they hold out-of-sample performance guarantees. Then, we introduce a new regularizer for empirical value functions and show that it lower bounds the Wasserstein distributionally robust value function. We extend the result to linear value function approximation for large state spaces. Our approach provides an alternative formulation of robustness with guaranteed finite-sample performance. Moreover, it suggests using regularization as a practical tool for dealing with $ extit{external uncertainty}$ in reinforcement learning methods.
연구 동기 및 목표
- 분포로 인한 강건성과 정규화 사이의 격차를 해소하기 위해, 분포로 인한 강건성과 정규화 사이의 이중 관계를 수학적으로 정의한다.
- 모델의 잘못된 특정화와 같은 외부 불확실성을 다루기 위해 전이 및 보상 분포에 대한 워샤프스키 기반의 모호성 집합을 설정한다.
- 분포로 인한 최적화를 사용하여, 강건한 강화학습 정책의 유한 샘플 분포 외 성능 보장을 제공한다.
- 큰 상태 공간에서 선형 가치 함수 근사에 대해 강건성-정규화 이중성을 확장한다.
- 분포로 인한 강건 정책의 행동을 모방함으로써 일반화를 향상시키는 실용적인 정규화 기법을 제안한다.
제안 방법
- 경험적 전이 및 보상 분포 중심의 워샤프스키 모호성 집합을 사용하여 워샤프스키 기반의 분포로 인한 강건 MDP를 제안한다.
- 경험적 가치 함수에 대한 새로운 정규화 기법을 정의하여, 분포로 인한 강건 정책의 가치를 하한으로 보장한다.
- 분포로 인한 최적화의 이중 형식을 사용하여 순차적 의사결정에서 강건성과 정규화 간의 연결을 유도한다.
- 수축 사상 원리와 농도 불등식을 적용하여 강건 가치 함수에 대한 유한 샘플 확률적 보장을 유도한다.
- 파rameterized 가치 함수 하에서 강건성을 유지하는 정규화된 목적 함수를 유도함으로써 프레임워크를 선형 함수 근사로 확장한다.
- 샘플 크기와 신뢰 수준에 따라 조정되는 반경 기반의 모호성 집합을 사용하며, 이는 워샤프스키 거리로 정의된다.
실험 결과
연구 질문
- RQ1분포로 인한 강건 MDP는 강화학습에서 정규화와 공식적으로 연결될 수 있는가?
- RQ2경험적 가치 함수에 대한 정규화 기법이 분포로 인한 강건 가치 함수의 하한을 제공하는가?
- RQ3워샤프스키 기반의 분포로 인한 강건성 하에서 훈련된 정책에 대해 어떤 유한 샘플 성능 보장을 도출할 수 있는가?
- RQ4강건성과 정규화의 이중성은 선형 가치 함수 근사로 어떻게 확장될 수 있는가?
- RQ5제안된 정규화 기법은 복잡한 강건 MDP를 직접 해결하는 데 대한 실용적인 대체 방법이 될 수 있는가?
주요 결과
- 경험적 가치 함수에 적용된 제안된 정규화 기법이 워샤프스키 기반의 분포로 인한 강건 정책의 가치를 하한으로 보장하여, 정규화와 강건성 간의 직접적인 이중성을 확립한다.
- 이 방법은 유한 샘플 분포 외 성능 보장을 제공한다: 고확률적으로, 모호성 집합 내의 임의의 진짜 분포 하에서의 기대 수익은 강건 가치 함수 이하로 내려가지 않는다.
- 실패 확률가 ε 이하로 유한한 상태 수에 대해 균일하게 성립하며, 이는 경험 분포에 대한 농도 불등식에서 유도된다.
- 선형 가치 함수 근사의 경우, 정규화된 목적 함수는 동일한 강건성 성질을 유지하여 큰 상태 공간에 대한 확장 가능한 적용을 가능하게 한다.
- 워샤프스키 모호성 집합의 반경은 샘플 크기와 신뢰 수준에 따라 조정되며, 이는 진짜 분포가 고확률로 집합 내에 존재하도록 보장한다.
- 이 프레임워크는 특히 데이터가 부족한 환경에서 계산적으로 어려운 강건 MDP를 해결하는 데 있어 정규화를 실용적인 대체 수단으로 사용할 수 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.