Skip to main content
QUICK REVIEW

[논문 리뷰] Differentiable Trust Region Layers for Deep Reinforcement Learning

Fabian Otto, Philipp Becker|arXiv (Cornell University)|2021. 01. 22.
Reinforcement Learning in Robotics참고 문헌 30인용 수 6
한 줄 요약

이 논문은 깊이 강화 학습에서 상태별 정책 제약 조건을 클로저-폼 투영을 통해 Kullback-Leibler 발산, Wasserstein L2 거리, 그리고 Frobenius 노름 기반으로 강제하는 가분성 있는 신뢰 영역 투영 레이어를 소개한다. 이 방법은 PPO 및 TRPO와 동등하거나 그 이상의 성능를 달성하면서도 더 안정적이고 구현 선택에 덜 민감하며, 희소 보상 제어 작업에서 경험적으로 검증되었다.

ABSTRACT

Trust region methods are a popular tool in reinforcement learning as they yield robust policy updates in continuous and discrete action spaces. However, enforcing such trust regions in deep reinforcement learning is difficult. Hence, many approaches, such as Trust Region Policy Optimization (TRPO) and Proximal Policy Optimization (PPO), are based on approximations. Due to those approximations, they violate the constraints or fail to find the optimal solution within the trust region. Moreover, they are difficult to implement, often lack sufficient exploration, and have been shown to depend on seemingly unrelated implementation choices. In this work, we propose differentiable neural network layers to enforce trust regions for deep Gaussian policies via closed-form projections. Unlike existing methods, those layers formalize trust regions for each state individually and can complement existing reinforcement learning algorithms. We derive trust region projections based on the Kullback-Leibler divergence, the Wasserstein L2 distance, and the Frobenius norm for Gaussian distributions. We empirically demonstrate that those projection layers achieve similar or better results than existing methods while being almost agnostic to specific implementation choices. The code is available at https://git.io/Jthb0.

연구 동기 및 목표

  • 기존의 신뢰 영역 방법이 깊이 강화 학습에서 겪는 불안정성과 구현 민감성 문제를 해결하기 위해.
  • 가우시안 정책을 위한 정확한, 상태 기반의 신뢰 영역 제약 조건을 강제하여 단조 증가 보장 가능성을 확보하기 위해.
  • 정책 갱신을 신뢰 영역에 투영하는 가분성 있는 신경망 레이어를 개발하여 폐쇄형 해법을 사용하기 위해.
  • 정책 최적화에 영향을 주는 다양한 유사도 측정법—KL 발산, Wasserstein L2, Frobenius 노름—의 영향을 평가하기 위해.
  • 벌점 기반 회귀를 통한 신뢰 영역 투영의 근사화가 정확한 투영을 효과적으로 근사하면서도 계산 비용을 줄일 수 있는지 확인하기 위해.

제안 방법

  • 기존 정책로 정의된 신뢰 영역에 갱신된 정책을 투영하는 가분성 있는 신경망 레이어를 제안하며, 가우시안 분포에 대해 폐쇄형 해법을 사용한다.
  • 세 가지 유사도 측정법을 사용: Kullback-Leibler 발산, Wasserstein L2 거리, Frobenius 노름을 통해 신뢰 영역을 정의한다.
  • 예측된 정책이 기존 정책에 가까워지도록 벌점 항을 포함한 신뢰 영역 회귀 손실을 도입하여 정확한 신뢰 영역 갱신을 근사한다.
  • 완전한 반복적 투영 대신, 표준 딥 러닝 프레임워크와 함께 효율적인 학습이 가능한, 벌점 기반 최적화를 사용한다.
  • 어려운 환경에서의 탐색 성능 향상을 위해 엔트로피 제어를 통합하여 프레임워크를 확장한다.
  • 제안된 레이어를 온-폴리시 학습 파이프라인 내에 통합하여, PPO와 같은 기존 강화 학습 알고리즘과 원활하게 통합한다.

실험 결과

연구 질문

  • RQ1가분성 있는 신뢰 영역 레이어가 기존의 평균 정책 변화만 제약하는 방법보다 더 날카운, 상태 기반의 정책 제약 조건을 강제할 수 있는가?
  • RQ2KL 발산, Wasserstein L2, Frobenius 노름 등 다양한 유사도 측정법이 정책 최적화 및 최종 성능에 어떤 영향을 미치는가?
  • RQ3신뢰 영역 투영의 벌점 기반 근사는 제약 조건 강제 및 학습 안정성 유지에 얼마나 효과적인가?
  • RQ4희소 보상 환경에서 탐색이 핵심적인 상황에서 제안된 레이어가 성능 향상에 기여할 수 있는가?
  • RQ5PPO 및 TRPO에 비해 이론적 수준의 하이퍼파rameter 설정에 얼마나 민감한가?

주요 결과

  • 신뢰 영역 레이어는 여러 MuJoCo 환경에서 PPO 및 TRPO와 동등하거나 그 이상의 성능를 달성하며, 특히 희소 보상 설정에서 유의미한 성능 향상을 보였다.
  • KL 기반 투영이 가장 우수한 성능를 보였지만, 수치 최적화가 필요하다; Wasserstein L2 투영은 하이퍼파rameter 설정에 더 강건하고 계산 속도가 빠르다.
  • Frobenius 노름 투영은 수렴 근처에서 공분산이 매우 작아질 경우 수치적 불안정성 문제를 겪어 효과가 제한된다.
  • 희소 보상이 적용된 5링크 Reacher 환경에서, 제안된 방법은 특히 문맥 기반 공분산을 사용할 경우 기존 기준보다 유의미하게 뛰어난 성능를 보였다.
  • 벌점 기반 회귀 근사는 정확한 신뢰 영역 제약 조건을 효과적으로 유지하며, 완전한 반복적 투영 없이도 안정적인 학습이 가능했다.
  • 보상 스케일링, 클리핑, 가치 함수 정규화에 대한 의존도가 낮아 PPO보다 구현 수준의 선택에 덜 민감하다는 점에서 메서드의 안정성이 높아 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.