[논문 리뷰] Policy Expansion for Bridging Offline-to-Online Reinforcement Learning
이 논문은 오프라인-온라인 강화학습을 향상시키기 위해 사전 훈련된 오프라인 정책을 정책 집합에 유지하면서 온라인 미세조정을 위한 새로운 정책을 도입하는 Policy Expansion (PEX)을 제안한다. 상호작용 중 두 정책은 적응적으로 조합되며, 오프라인 지식을 유지하고 상호보완적인 탐색을 가능하게 하여 벤치마크 작업 전반에서 샘플 효율성과 성능 향상을 이룬다.
Pre-training with offline data and online fine-tuning using reinforcement learning is a promising strategy for learning control policies by leveraging the best of both worlds in terms of sample efficiency and performance. One natural approach is to initialize the policy for online learning with the one trained offline. In this work, we introduce a policy expansion scheme for this task. After learning the offline policy, we use it as one candidate policy in a policy set. We then expand the policy set with another policy which will be responsible for further learning. The two policies will be composed in an adaptive manner for interacting with the environment. With this approach, the policy previously learned offline is fully retained during online learning, thus mitigating the potential issues such as destroying the useful behaviors of the offline policy in the initial stage of online learning while allowing the offline policy participate in the exploration naturally in an adaptive manner. Moreover, new useful behaviors can potentially be captured by the newly added policy through learning. Experiments are conducted on a number of tasks and the results demonstrate the effectiveness of the proposed approach. Code is available at https://github.com/Haichao-Zhang/PEX
연구 동기 및 목표
- 온라인 RL에서 사전 훈련된 오프라인 정책를 미세조정할 때 발생하는 치명적인 잊음과 분포 이탈 문제를 해결하기 위해.
- 온라인 훈련 중에 오프라인 정책가 온라인 탐색에 적극적으로 기여하면서도, 온라인 학습 과정에서 덮어쓰이지 않도록 보장하기 위해.
- 기존 오프라인 및 온라인 RL 알고리즘과 결합할 수 있는 간단하고 모듈러한 프레임워크를 개발하기 위해.
- 사전 훈련된 행동을 활용하면서도 새로운 행동이 나타나도록 허용하여 온라인 RL의 샘플 효율성과 최종 성능을 향상시키기 위해.
- 기존의 통합 오프라인-온라인 RL 알고리즘을 개발하는 데 대안으로 기능하는 수직적 접근을 제공하기 위해.
제안 방법
- 이 방법은 사전 훈련된 오프라인 정책 $\pi_\beta$와 새로 초기화된 정책 $\pi_\theta$를 포함하는 정책 집합을 유지한다.
- 온라인 상호작용 중 최종 행동은 라우팅 네트워크에 의해 제어되는 학습 가능한 적응적 조합 방식으로 $\pi_\beta$와 $\pi_\theta$ 중 하나를 선택한다.
- 라우팅 네트워크는 현재 상태에 기반해 각 정책의 선택 확률을 결정하여 동적 정책 전환을 가능하게 한다.
- 온라인 훈련 중 오프라인 정책 $\pi_\beta$는 동결되어 있어 학습 과정 전반에 걸쳐 그 행동이 유지된다.
- 새로운 정책 $\pi_\theta$는 표준 오프-폴리시 RL 알고리즘(예: SAC)을 사용해 온라인으로 훈련되며, 새로운 행동을 학습할 수 있다.
- 이 방법은 기존의 오프라인(예: IQL) 및 온라인(예: SAC) RL 방법과 호환되어 플러그 앤 플레이 통합이 가능하다.
실험 결과
연구 질문
- RQ1온라인 미세조정 중 오프라인 정책를 유지함으로써 치명적인 잊음으로 인한 성능 저하를 방지할 수 있는가?
- RQ2오프라인 및 온라인 정책의 적응적 조합이 온라인 RL에서 탐색과 샘플 효율성을 향상시킬 수 있는가?
- RQ3제안된 정책 확장 기법이 오프라인-온라인 RL 환경에서 단일 정책으로의 표준 미세조정보다 성능이 뛰어나게 되는가?
- RQ4집합 내 두 정책가 상태 공간 전반에서 어떻게 사용되는가? 그리고 상호보완적인 행동을 보이는가?
- RQ5알고리즘 설계 재편이 필요 없이 다양한 오프라인 및 온라인 RL 알고리즘과 효과적으로 통합될 수 있는가?
주요 결과
- 제안된 PEX 방법은 AntMaze 및 HalfCheetah를 포함한 여러 벤치마크 작업에서 일관된 성능 향상을 달성했다.
- AntMaze-medium-diverse 환경에서 PEX는 표준 미세조정 및 기타 베이스라인을 능가했으며, 더 높은 최종 수익을 기록하고 더 빠른 수렴을 보였다.
- 시각화 결과 오프라인 정책 $\pi_\beta$는 주로 안전하고 잘 알려진 영역에서 사용되었고, $\pi_\theta$는 새로운 및 도전적인 상태에서 탐색했다.
- 적응적 조합 메커니즘은 정책 집합이 행동을 동적으로 전환할 수 있게 했으며, $\pi_\theta$는 높은 불확실성 또는 탐색되지 않은 영역에서 주로 작동했다.
- 이 방법은 다양한 오프라인 사전 훈련 알고리즘과 온라인 RL 방법에 대해 뛰어난 강건성을 보였으며, 일반화 능력을 확인했다.
- 이 방법은 온라인 훈련 전반에 걸쳐 오프라인 정책의 성능을 유지했으며, 표준 미세조정에서 관찰되는 성능 저하를 방지했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.