[논문 리뷰] PROTO: Iterative Policy Regularized Offline-to-Online Reinforcement Learning
PROTO는 오프라인에서 온라인 강화학습으로의 전이 과정에서 안정적인 온라인 피니팅을 위해 반복적인 정책 정규화 프레임워크를 제안한다. 이는 변화하는 정책에 기반한 동적 정규화를 통해 신뢰영역 스타일 업데이트를 통해 점진적으로 보수성을 완화함으로써 이루어진다. 고정된 정책 제약 조건을 최근 정책 기반의 동적 정규화로 대체함으로써, 최소한의 계산 오버헤드와 높은 적응성으로 다양한 사전학습 및 피니팅 방법에 걸쳐 최신 기술 성능을 달성한다.
Offline-to-online reinforcement learning (RL), by combining the benefits of offline pretraining and online finetuning, promises enhanced sample efficiency and policy performance. However, existing methods, effective as they are, suffer from suboptimal performance, limited adaptability, and unsatisfactory computational efficiency. We propose a novel framework, PROTO, which overcomes the aforementioned limitations by augmenting the standard RL objective with an iteratively evolving regularization term. Performing a trust-region-style update, PROTO yields stable initial finetuning and optimal final performance by gradually evolving the regularization term to relax the constraint strength. By adjusting only a few lines of code, PROTO can bridge any offline policy pretraining and standard off-policy RL finetuning to form a powerful offline-to-online RL pathway, birthing great adaptability to diverse methods. Simple yet elegant, PROTO imposes minimal additional computation and enables highly efficient online finetuning. Extensive experiments demonstrate that PROTO achieves superior performance over SOTA baselines, offering an adaptable and efficient offline-to-online RL framework.
연구 동기 및 목표
- 분포 이탈과 과도한 보수성으로 인한 초반 성능 저하 및 최적 정책 성능 미달 문제를 해결하기 위해.
- 고정된 제약 조건이나 특정 사전학습 프레임워크에 의존하는 기존 방법의 제한된 적응성 문제를 극복하기 위해.
- 앙상블 모델이나 복잡한 보수적 학습 기반 기법을 피하여 계산 효율성을 향상시키기 위해.
- 최소한의 코드 수정으로 다양한 오프라인 사전학습 및 온정책/오프정책 피니팅 방법과 원활하게 통합 가능하도록 하기 위해.
- 지속적인 보수성으로 인한 최적성 저하를 유발하지 않고 최종 성능을 최적화하기 위해.
제안 방법
- 사전학습된 고정 정책 $\pi_0$ 가 아닌 최근에 업데이트된 정책 $\pi_k$ 를 기준으로 피니팅 정책이 가까이 유지되도록 반복적인 정책 정규화 항을 도입한다.
- 정책 $\pi_{k+1}$ 와 $\pi_k$ 간의 제곱 차이를 기반으로 한 정규화 손실을 최소화하는 방식으로 신뢰영역 스타일 업데이트를 수행하여 안정적인 정책 업데이트를 보장한다.
- 반복 과정에 따라 점차 보수성을 완화하기 위해 선형적으로 감쇠하는 정규화 강도 $\alpha$ 를 사용하여 후반 단계에서의 과도한 보수성을 방지한다.
- SAC 및 TD3 기반 피니팅에 모두 정규화 항을 적용하며, 결정성 정책을 위한 MSE 기반 정규화 손실을 목적 함수에 통합한다.
- TD3에서 Q-값과 정규화 손실을 균형 있게 조절하기 위해 스케일링 인자 $\lambda$ 를 활용하여 초과 조정 파rameter 문제 없이 안정적인 학습을 보장한다.
- 표준 오프정책 강화학습 알고리즘에 최소한의 코드 수정으로 즉시 통합 가능하며, 계산 효율성을 유지한다.
실험 결과
연구 질문
- RQ1진행 중인 정책에 기반한 반복적 정책 정규화가 오프라인에서 온라인 강화학습의 초반 피니팅 안정성과 최종 성능 향상에 기여하는가?
- RQ2고정된 정책 제약 조건을 동적 정규화로 대체할 경우, 하위최적성은 감소시키면서도 분포 이탈에 대한 강건성을 유지할 수 있는가?
- RQ3최소한의 아키텍처 변경으로 다양한 사전학습 방법(예: BC, CQL)과 피니팅 알고리즘(예: SAC, TD3)에 걸쳐 최신 기술 성능을 달성할 수 있는가?
- RQ4실제로 PROTO의 계산 비용은 앙상블 기반 또는 보수적 강화학습 방법과 비교해 어떻게 되는가?
- RQ5반복적 정규화가 고정 정규화에 비해 샘플 효율성과 최종 성능 측면에서 얼마나 뛰어나게 성능을 냈는가?
주요 결과
- PROTO는 D4RL 벤치마크에서 다양한 환경에서 최신 기술 성능을 달성하며 기존 최신 기술 기반 보다 뛰어난 성능을 보였다.
- PROTO는 단순한 행동 클로닝(BC) 정책에서 시작하더라도 안정적인 온라인 피니팅을 가능하게 하여 복잡한 오프라인 사전학습이 필요 없음을 입증했다.
- 계산 효율성이 매우 높으며, SAC 및 TD3와 같은 표준 오프정책 강화학습 알고리즘과 비교해 거의 무시할 수 없는 오버헤드를 보였다.
- 실험 결과, 고정 정책 정규화(예: Frozen)는 지속적인 과도한 보수성으로 인해 심각한 성능 정체에 시달리는 반면, PROTO의 반복적 접근은 이 문제를 피했다.
- PROTO+TD3는 16개의 작업에서 경쟁 가능한 성능을 달성하여, 단지 소수의 수정으로 다양한 온라인 강화학습 알고리즘에 넓은 적응성을 보였다.
- 제거 실험 결과, 선형적으로 감쇠하는 보수성 조건을 적용한 반복 정규화가 고정 정규화보다 더 빠른 학습 속도와 더 나은 최종 성능을 보였음을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.