Skip to main content
QUICK REVIEW

[논문 리뷰] Offline Reinforcement Learning with Fisher Divergence Critic Regularization

Ilya Kostrikov, Jonathan Tompson|arXiv (Cornell University)|2021. 03. 14.
Reinforcement Learning in Robotics참고 문헌 32인용 수 25
한 줄 요약

Fisher-BRC는 로그-행동정책 기반 크리틱과 경사 패널티를 도입하여 Fisher 발산 규제화를 실현, 오프라인 RL에서 최첨단 성능을 달성하고 수렴 속도 및 안정성을 개선합니다.

ABSTRACT

Many modern approaches to offline Reinforcement Learning (RL) utilize behavior regularization, typically augmenting a model-free actor critic algorithm with a penalty measuring divergence of the policy from the offline data. In this work, we propose an alternative approach to encouraging the learned policy to stay close to the data, namely parameterizing the critic as the log-behavior-policy, which generated the offline data, plus a state-action value offset term, which can be learned using a neural network. Behavior regularization then corresponds to an appropriate regularizer on the offset term. We propose using a gradient penalty regularizer for the offset term and demonstrate its equivalence to Fisher divergence regularization, suggesting connections to the score matching and generative energy-based model literature. We thus term our resulting algorithm Fisher-BRC (Behavior Regularized Critic). On standard offline RL benchmarks, Fisher-BRC achieves both improved performance and faster convergence over existing state-of-the-art methods.

연구 동기 및 목표

  • 오프라인 RL에서 보지 못한 행동들에 대한 외삽을 방지하기 위해 크리틱에 대한 규제자를 제안한다.
  • Q-값을 로그 밀도 항과 학습 가능한 보정치를 통해 행동 정책 μ(a|s)와 연결시키는 크리틱 파라미터화를 제안한다.
  • 오프셋에 대한 그래디언트 패널티 정규화를 Fisher 발산 규화와 동등하게 도출한다.
  • Fisher-BRC를 통해 기존 오프라인 RL 방법에 비해 성능과 효율 측면에서 실험적 이점을 보인다.

제안 방법

  • 크리틱을 Q(s,a)=Oθ(s,a)+log μ(a|s)로 매개화하고, μ는 행동 클로닝을 통해 학습된 행동 정책이다.
  • Oθ에 대한 그래디언트 패널티로 크리틱을 정규화한다: 최소화 J(Oθ+log μ) + λ E_{s,a∼D, a∼πφ(·|s)}[||∇a Oθ(s,a)||^2].
  • 그래디언트 패널티를 볼츠만 정책 exp(Q)/Z와 행동 정책 μ 사이의 Fisher 발산과 연결하되 명시적 정규화를 피한다.
  • 오프셋 기반 크리틱을 이용해 데이터 쪽으로 행동을 유도하면서 데이터 세트를 넘는 일반화를 허용하도록 엔트로피 정규화를 적용해 정책을 학습한다.
  • Fisher-BRC를 BRAC와 CQL과 연계하고, log-sum-exp 기반 목표에 비해 계산적 이점을 지적한다.

실험 결과

연구 질문

  • RQ1로그-행동정책 기반 크리틱과 오프셋 그래디언트 정규화가 강건한 오프라인 RL 성능을 낼 수 있는가?
  • RQ2크리틱의 오프셋에 대한 그래디언트 패널티가 Fisher 발산 규화를 구현하고 전통적 발산 정규화 정책보다 이점을 제공하는가?
  • RQ3Fisher-BRC 방법이 표준 벤치마크에서 최첨단 오프라인 RL 베이스라인보다 더 빠르게 수렴하고 더 나은 안정성을 제공하는가?

주요 결과

  • Fisher-BRC는 D4RL 벤치마크 전반에서 최첨단 결과에 근접하며, 여러 베이스라인보다 성능의 일관성이 더 높다.
  • 그래디언트 패널티는 결정적이다: λ=0은 성능을 악화시키고, 매우 큰 λ는 정책을 과도하게 제약한다.
  • Fisher-BRC는 그래디언트 스텝 수와 실제 시간에서 CQL 및 BRAC보다 더 빠르게 수렴한다.
  • 이 방법은 중간 및 전문가 데이터셋에서 특히 강한 성과를 보이며 태스크 전반에 걸친 강건성을 입증한다.
  • 이 접근법은 비싼 log-sum-exp 계산을 피함으로써 CQL에 비해 계산 부담을 줄인다.
  • 실험 결과 대부분의 태스크에서 베이스라인과 비슷하거나 이를 능가하고, 수렴 행동이 개선된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.