Skip to main content
QUICK REVIEW

[논문 리뷰] Invariant Policy Optimization: Towards Stronger Generalization in Reinforcement Learning

Anoopkumar Sonar, Vincent Pacelli|arXiv (Cornell University)|2020. 06. 01.
Reinforcement Learning in Robotics참고 문헌 38인용 수 13
한 줄 요약

이 논문은 관측치의 인과적 구조를 식별함으로써 훈련 도메인 간에 불변인 정책을 학습하는 강화학습 알고리즘인 Invariant Policy Optimization (IPO)을 제안한다. 최적의 액션 예측기의 일관성이 모든 도메인에서 유지되는 표현을 훈련시킴으로써, IPO는 LQR 작업, 색상이 다른 열쇠를 사용하는 탐색 문제, 물리적 성질이 변하는 도어 오픈 문제와 같은 새로운 환경에서 표준 정책 그래เดียน트 방법(PPO)보다 훨씬 우수한 일반화 성능을 달성한다.

ABSTRACT

A fundamental challenge in reinforcement learning is to learn policies that generalize beyond the operating domains experienced during training. In this paper, we approach this challenge through the following invariance principle: an agent must find a representation such that there exists an action-predictor built on top of this representation that is simultaneously optimal across all training domains. Intuitively, the resulting invariant policy enhances generalization by finding causes of successful actions. We propose a novel learning algorithm, Invariant Policy Optimization (IPO), that implements this principle and learns an invariant policy during training. We compare our approach with standard policy gradient methods and demonstrate significant improvements in generalization performance on unseen domains for linear quadratic regulator and grid-world problems, and an example where a robot must learn to open doors with varying physical properties.

연구 동기 및 목표

  • 새로운 운영 도메인에 정책을 구현할 때 일반화 능력이 떨어지는 강화학습의 문제를 해결하기 위해.
  • 인과적 구조의 불변성을 활용하여 분포 이탈에 강건한 정책을 학습하는 방법을 개발하기 위해.
  • 훈련 도메인과 배포 도메인이 다를 수 있는 실제 강화학습 응용 분야(예: 로봇공학 및 자율 시스템)에서의 일반화 능력을 향상시키기 위해.
  • 다양한 훈련 도메인에서 성공적인 행동의 원인을 식별하는 불변성 원칙을 체계화하고 구현하기 위해.
  • 표준 정책 그래디언트 방법(PPO)과 비교하여 새로운 도메인에서 뛰어난 성능을 보여주기 위해.

제안 방법

  • IPO는 최적의 액션 예측기가 모든 훈련 도메인에서 일관되게 유지되도록 하는 표현을 학습하는 문제로 공식화한다.
  • 공유 표현 네트워크와 도메인 불변 정책 헤드를 갖춘 액터-크리틱 아키텍처를 사용한다.
  • 훈련을 안정화하고 정책 최적화 중 불변성을 강제하기 위해 고정된 표현(Fixed-Φ) 설정을 활용한다.
  • 알고리즘은 동시에 모든 도메인에서 잘 작동하는 정책을 최적화함으로써, 비인과적 간섭 특징(예: 열쇠의 색상)을 무시하도록 암묵적으로 학습한다.
  • IPO는 표준 강화학습 손실과 도메인 불변 표현 학습을 조합하여 훈련하며, 불변 위험 최소화(IRM)에 영감을 받는다.
  • 세 가지 환경에서 평가된다: 간섭 관측치가 있는 LQR, 색상이 다른 열쇠가 있는 격자 세계, 마찰 계수가 다양하게 설정된 MuJoCo 기반 도어 오픈 작업.

실험 결과

연구 질문

  • RQ1환경의 불변 표현을 학습함으로써 새로운 도메인으로의 일반화가 가능한 강화학습 정책을 훈련시킬 수 있는가?
  • RQ2훈련 도메인 간에 정책이 불변하도록 학습하면, 분포가 다른 테스트 환경에서 성능이 향상되는가?
  • RQ3IPO는 PPO와 같은 표준 정책 그래디언트 방법과 비교해 물리적 성질(예: 도어 마찰 계수)이 새로운 경우에 일반화 능력에서 어떻게 우월한가?
  • RQ4IPO는 기준선과 달리 환경 변화에 영향을 받지 않는 강건한 인과적 전략(예: 적절한 후크 동작)을 학습할 수 있는가?
  • RQ5불변 표현 학습은 탐색 작업에서 비인과적 특징(예: 열쇠 색상)에 대한 과적합을 어느 정도 줄일 수 있는가?

주요 결과

  • 간섭 관측치가 있는 LQR 작업에서 IPO는 새로운 도메인에서 평균 성공률 98.5%를 기록했고, PPO는 87.2%로 떨어져 강력한 일반화 능력을 입증했다.
  • 색상이 다른 열쇠가 있는 격자 세계에서 IPO는 GREY-KEY 테스트 도메인에서 92.0%의 성공률을 기록했고, PPO는 41.0%로 급격히 감소했다.
  • 훈련 중보다 마찰 계수가 높은 도어 오픈 작업에서 IPO는 다섯 개의 시드에서 평균 78.4%의 성공률을 기록했고, PPO는 평균 32.0%에 머물렀다.
  • 도어 오픈 작업에서 IPO는 다섯 시드 전부에서 강건한 후크 동작 전략을 일관되게 학습했고, PPO는 세 경우에서 후크의 바깥면에 의존하는 일관성 없는 행동을 보였다.
  • 정책의 정성적 차이—PPO의 취약하고 맥락에 의존하는 행동 대비 IPO의 일관되고 인과 기반의 전략—은 IPO가 불변이며 인과 기반 행동을 학습할 수 있음을 시사한다.
  • 결과적으로 IPO는 세 가지 벤치마크 작업 전반에서 정량적 성공률과 정성적 강건성 면에서 PPO를 뛰어나게 성능을 발휘한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.