Skip to main content
QUICK REVIEW

[논문 리뷰] Offline Reinforcement Learning with Soft Behavior Regularization

Haoran Xu, Xianyuan Zhan|arXiv (Cornell University)|2021. 10. 14.
Reinforcement Learning in Robotics참고 문헌 59인용 수 9
한 줄 요약

이 논문은 상태에 따라 변화하는 밀도 비율을 사용하여 행동 정규화를 부드럽게 하는 소프트 행동 정규화 액터-크리틱(SBAC)을 제안한다. 이는 더 나은 정책 성능과 안정성을 가능하게 하며, 행동 정책의 이점에 상태 방문 비율을 가중치로 적용함으로써 기존 방법을 개선한다. 성능 향상 보장과 상태별 정규화를 통해 MuJoCo 및 Adroit 벤치마크에서 최신 기술(SOTA)을 초월한다.

ABSTRACT

Most prior approaches to offline reinforcement learning (RL) utilize extit{behavior regularization}, typically augmenting existing off-policy actor critic algorithms with a penalty measuring divergence between the policy and the offline data. However, these approaches lack guaranteed performance improvement over the behavior policy. In this work, we start from the performance difference between the learned policy and the behavior policy, we derive a new policy learning objective that can be used in the offline setting, which corresponds to the advantage function value of the behavior policy, multiplying by a state-marginal density ratio. We propose a practical way to compute the density ratio and demonstrate its equivalence to a state-dependent behavior regularization. Unlike state-independent regularization used in prior approaches, this extit{soft} regularization allows more freedom of policy deviation at high confidence states, leading to better performance and stability. We thus term our resulting algorithm Soft Behavior-regularized Actor Critic (SBAC). Our experimental results show that SBAC matches or outperforms the state-of-the-art on a set of continuous control locomotion and manipulation tasks.

연구 동기 및 목표

  • 기존 오프라인 강화학습 방법에서 상태에 독립적인 경직된 행동 정규화를 사용할 경우 성능 향상 보장이 부족한 문제를 해결하기 위해.
  • 오프라인 설정에서 적용 가능한 동시에 행동 정책보다 성능 향상을 보장하는 정책 학습 목표를 개발하기 위해.
  • 높은 신뢰도 상태에서 더 큰 정책 이탈을 允허하는 실용적인 상태 종속 정규화 메커니즘을 도입하기 위해.
  • 마진 상태 방문 비율을 활용하여 분포 이탈을 줄이고 평가 시의 강인성을 향상시키기 위해.
  • 기존 행동 정규화 오프라인 강화학습 알고리즘보다 더 강력하고 안정적인 성능을 표준 벤치마크에서 달성하기 위해.

제안 방법

  • 할인된 상태 마진 밀도 비율로 가중된 행동 정책의 이점을 기반으로 한 새로운 정책 목표를 유도하여 보장된 정책 향상을 가능하게 한다.
  • 온라인 롤아웃이 필요 없도록 오프라인 데이터를 이용해 상태 방문 밀도 비율을 추정하는 실용적인 방법을 제안한다.
  • 밀도 비율을 상태 종속 정규화 항으로 재해석하여 고정된 또는 엔트로피 기반 페널티를 대체한다.
  • 유도된 목표를 Q함수와 정책 갱신에 통합한 모델리스 알고리즘인 소프트 행동 정규화 액터-크리틱(SBAC)을 도입한다.
  • 목표에서 $Q^{ u}$를 $Q^{ u}$의 사다리로 사용함으로써 학습 안정성을 향상시킨다.
  • 상태 신뢰도에 따라 정규화 강도를 동적으로 조정하는 가중치 정책 갱신을 사용하여 저커니지 상태에서 더 많은 탐색을 가능하게 한다.

실험 결과

연구 질문

  • RQ1상태 종속 행동 정규화 기법이 오프라인 강화학습에서 행동 정책보다 보장된 성능 향상을 이끌 수 있는가?
  • RQ2모델리스 오프라인 강화학습 설정에서 마진 상태 방문 비율을 효과적으로 추정하고 활용할 수 있는가?
  • RQ3부드럽고 상태 종속 정규화가 경직되고 상태에 독립적인 정규화보다 최종 성능과 학습 안정성 측면에서 뛰어난가?
  • RQ4제안된 방법이 D4RL 및 Adroit와 같은 도전적인 연속 제어 벤치마크에서 최신 기술 성능을 달성할 수 있는가?
  • RQ5기존의 OPE 및 행동 정규화 기법과 비교해 분포 이탈과 분포 외 행동을 다룰 때 어떻게 성능을 발휘하는가?

주요 결과

  • SBAC는 D4RL 벤치마크에서 표준 MuJoCo 이동 및 조작 작업에서 최신 기술 성능을 달성한다.
  • 특히 복잡한 제어 환경에서 SAC, TD3, BCQ와 같은 기존 방법보다 성능이 뛰어나거나 동등하다.
  • 다양한 랜덤 시드에서 상당히 낮은 분산과 더 안정적인 학습 곡선을 보이며 강인성을 입증한다.
  • 제거 실험에서는 상태 종속 가중치 $w^{ u}(s)$를 제거할 경우 성능 저하와 안정성 감소가 발생함을 보여준다.
  • $Q^{ u}$를 $Q^{ u}$로 대체한 실험보다 SBAC가 더 나은 성능을 내어, 정규화에 행동 정책의 Q값을 사용하는 것이 중요함을 시사한다.
  • AlgaeDICE와 비교해도 성능이 뛰어나며, 이는 min-max 최적화에서의 불안정성으로 인한 성능 열 劣로 인해 AlgaeDICE가 열 劣를 보임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.