[논문 리뷰] Offline RL Without Off-Policy Evaluation
이 논문은 행동 정책의 온정책 Q 추정치를 사용하여 단일 단계의 정책 개선 알고리즘을 제안하며, 대부분의 D4RL 벤치마크에서 반복적인 오프정책 액터-크리틱 방법보다 우수한 성능을 보인다. 이 방법은 오프정책 평가를 완전히 회피하여 분산과 오차 전파를 줄이며, 이전의 반복적 접근보다 더 간단하고 강건한 상태의 최고 성능을 달성한다.
Most prior approaches to offline reinforcement learning (RL) have taken an iterative actor-critic approach involving off-policy evaluation. In this paper we show that simply doing one step of constrained/regularized policy improvement using an on-policy Q estimate of the behavior policy performs surprisingly well. This one-step algorithm beats the previously reported results of iterative algorithms on a large portion of the D4RL benchmark. The one-step baseline achieves this strong performance while being notably simpler and more robust to hyperparameters than previously proposed iterative algorithms. We argue that the relatively poor performance of iterative approaches is a result of the high variance inherent in doing off-policy evaluation and magnified by the repeated optimization of policies against those estimates. In addition, we hypothesize that the strong performance of the one-step algorithm is due to a combination of favorable structure in the environment and behavior policy.
연구 동기 및 목표
- 오프정책 평가에 의존하는 반복적 액터-크리틱 알고리즘의 지배적 패러다임에 도전하기 위해.
- 복잡한 이론적 설계에도 불구하고 실무에서 반복적 알고리즘이 자주 실패하는 이유를 탐구하기 위해.
- 표준 오프라인 강화학습 벤치마크에서 복잡한 반복적 방법보다 단일 단계 정책 개선 기반 방법이 더 뛰어난 성능을 낼 수 있음을 보여주기 위해.
- 반복적 알고리즘이 여전히 단일 단계 기반 방법보다 뛰어날 수 있는 조건을 특정하기 위해.
- 실무자들이 오프라인 강화학습에서 단일 단계 방법과 반복적 방법을 언제 사용할지에 대한 실용적 지침을 제공하기 위해.
제안 방법
- 이 방법은 행동 정책의 온정책 Q 추정치를 사용하여 단일 단계의 정책 개선을 수행하며, 오프정책 평가를 완전히 회피한다.
- 새로운 정책이 행동 정책 분포에 가까워지도록 제약 또는 정규화된 정책 갱신을 사용한다.
- 알고리즘은 오프라인 데이터셋에서 직접 계산된 행동 정책의 Q 함수 $ \widehat{Q}^\beta $에 의존하여 정책 개선을 이끈다.
- 행동 데이터의 분포 이탈을 방지하기 위해 정규화된 목표를 사용하여 단일 업데이트 스텝으로 정책을 최적화한다.
- 오프정책 Q 추정의 추정 오차가 누적되는 것을 방지하기 위해 반복적 개선 및 동적 프rogramming 단계를 회피한다.
- 하이퍼파rameter는 오프라인 강화학습에서 일반적인 관행에 따라 소규모 환경 세트에서 튜닝된다.
실험 결과
연구 질문
- RQ1오프라인 강화학습에서 반복적 액터-크리틱 알고리즘이 복잡한 설계에도 불구하고 자주 성능이 열 劣하는 이유는 무엇인가?
- RQ2단일 단계 정책 개선 방법이 오프라인 강화학습에서 복잡한 반복적 알고리즘보다 뛰어날 수 있는가?
- RQ3오프정책 평가의 실패 모드는 반복적 알고리즘 성능을 악화시키는 주요 원인인가?
- RQ4오프정책 평가가 얼마나 신뢰할 수 있을 정도로 안정적이게 되면 반복적 방법을 사용하는 것이 타당한가?
- RQ5오프라인 강화학습에서 단일 단계 기반 방법이 반복적 접근보다 더 유리한 조건은 무엇인가?
주요 결과
- 이 단일 단계 알고리즘은 D4RL 벤치마크 세트의 대부분의 작업, 특히 대부분의 Gym-MuJoCo 및 Adroit 환경에서 이전에 보고된 반복적 알고리즘의 결과를 초월한다.
- 이 방법은 반복적 방법보다 훨씬 단순하고 하이퍼파rameter 선택에 더 강건하며, 대부분의 작업에서 최고 성능을 달성한다.
- 반복적 알고리즘의 주요 실패 원인으로는 반복적인 정책 최적화로 악화되는 오프정책 평가의 높은 분산이 밝혀졌다.
- 분포 이탈과 반복적 편향 증폭으로 인한 오차 전파가 반복적 방법의 핵심 실패 모드로 실험적으로 검증되었다.
- 행동 정책가 양호한 상태-행동 커버리지를 가지고 있고 데이터셋이 크다면, 반복적 알고리즘이 단일 단계 기반 방법을 능가할 수 있다.
- 실험 결과는 조그만 양의 중간 커버리지 행동 데이터(예: 혼합 데이터의 10%)조차도 단일 단계 방법이 반복적 접근을 능가하게 하며, 이는 기반 방법의 강력한 강건성을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.