Skip to main content
QUICK REVIEW

[논문 리뷰] Finetuning from Offline Reinforcement Learning: Challenges, Trade-offs and Practical Solutions

Yicheng Luo, Jackie Kay|arXiv (Cornell University)|2023. 03. 30.
Reinforcement Learning in Robotics인용 수 4
한 줄 요약

이 논문은 사전에 훈련된 오프라인 강화학습(RL) 정책을 온라인 오프폴리시 알고리즘을 사용해 미세조정하는 데에 초점을 맞추며, 초기 온라인 훈련 단계에서 심각한 성능 저하가 발생하는 '정책 붕괴'(policy collapse)를 핵심 과제로 규명한다. 이를 해결하기 위해 과대평가 오차를 완화함으로써 미세조정의 안정성을 높이는 제약된 정책 최적화 방법인 보수적 TD3(TD3-C)를 제안하며, 표준 오프라인 RL 미세조정보다 더 빠르고 신뢰할 수 있는 성능 향상을 달성한다.

ABSTRACT

Offline reinforcement learning (RL) allows for the training of competent agents from offline datasets without any interaction with the environment. Online finetuning of such offline models can further improve performance. But how should we ideally finetune agents obtained from offline RL training? While offline RL algorithms can in principle be used for finetuning, in practice, their online performance improves slowly. In contrast, we show that it is possible to use standard online off-policy algorithms for faster improvement. However, we find this approach may suffer from policy collapse, where the policy undergoes severe performance deterioration during initial online learning. We investigate the issue of policy collapse and how it relates to data diversity, algorithm choices and online replay distribution. Based on these insights, we propose a conservative policy optimization procedure that can achieve stable and sample-efficient online learning from offline pretraining.

연구 동기 및 목표

  • 온라인 RL 알고리즘을 사용한 오프라인 RL 정책의 미세조정에서 발생하는 과제와 상호 간의 상충관계를 조사하는 것.
  • 특히 데이터 분포와 알고리즘 선택과 관련된 원인을 규명하여 온라인 미세조정 중 정책 붕괴의 근본 원인을 특정하는 것.
  • 표준 오프라인 RL 미세조정 방법보다 우수한 성능을 내는 실용적이고 안정적이며 샘플 효율적인 온라인 미세조정 방법을 제안하는 것.
  • 데이터 다양성과 알고리즘 제약 조건을 강조하며, 효과적인 오프라인 사전훈련에서의 미세조정을 위한 경험적 지침을 제공하는 것.

제안 방법

  • 온라인 미세조정 동안 가치 함수 학습에서의 과대평가를 방지하기 위해 보수적 정규화를 통합한 TD3의 변형인 보수적 TD3(TD3-C)를 제안한다.
  • 오프라인 전이 데이터로 초기화된 하이브리드 리プレイ 버퍼를 사용하여 분포 이탈과 샘플 효율성의 균형을 이루도록 한다.
  • 오프라인 사전훈련된 정책에서의 정책 이탈을 제한하는 제약 조건이 적용된 정책 업데이트를 수행함으로써, 초기 온라인 학습 단계에서의 불안정성을 감소시킨다.
  • 표준 TD3, TD3-BC 및 오프라인 RL 미세조정 기반선과의 비교를 위해 표준 오프라인 및 온라인 RL 벤치마크에서 방법을 평가한다.
  • 온라인 리플레이 분포와 데이터 다양성이 정책 붕괴에 미치는 영향을 분석하여, 고정된 비적응형 리플레이가 불안정성을 악화시킨다는 것을 보여준다.
  • 알고리즘 선택, 리플레이 전략, 사전훈련 데이터 품질이 미세조정 성능에 미치는 영향을 분리하여 분석하기 위한 체계적인 아블레이션 연구를 수행한다.

실험 결과

연구 질문

  • RQ1표준 오프폴리시 RL 알고리즘을 사용한 온라인 미세조정가 비록 최종 성능은 더 좋게 나오지만, 왜 때로는 심각한 성능 저하(정책 붕괴)를 겪는가?
  • RQ2오프라인 데이터셋의 데이터 다양성과 분포는 온라인 미세조정의 안정성과 효율성에 어떤 영향을 미치는가?
  • RQ3보수적 정책 최적화는 오프라인 사전훈련에서 온라인 미세조정의 안정성을 향상시킬 수 있으며, 오프라인 RL을 위한 제약 조건과 비교해 볼 때 어떤가?
  • RQ4오프라인 RL에서의 미세조정에서 안정성과 성능 향상 간의 핵심 상충관계는 무엇이며, 평가 프로토콜은 관찰된 결과에 어떤 영향을 미치는가?

주요 결과

  • 표준 온라인 오프폴리시 알고리즘(예: TD3)을 사용한 미세조정은 오프라인 RL 알고리즘을 사용할 때보다 더 빠른 성능 향상을 보이지만, 고정된 초기 리플레이 분포에서의 과대평가 오차로 인해 정책 붕괴에 취약하다.
  • 온라인 리플레이 버퍼가 오프라인 데이터로 초기화되고 초기 훈련 동안 변경되지 않을 경우 정책 붕괴가 악화되며, 이는 열악한 피드백 신호와 최적화의 불안정성을 초래한다.
  • 제안된 보수적 TD3(TD3-C) 방법은 과대평가를 감소시키는 보수적 정규화를 적용함으로써 온라인 미세조정의 안정성을 높이며, 붕괴 없이 일관된 성능 향상을 이룬다.
  • 부적절한 전이 데이터까지 포함된 다양한 오프라인 데이터셋에서의 사전훈련은 정책과 크리틱 모두의 강건성을 향상시켜 더 안정적이고 효과적인 온라인 미세조정을 가능하게 한다.
  • 소수의 온라인 샘플만을 사용하는 평가 프로토콜은 안정적이지만 효율성이 떨어지는 알고리즘을 선호함을 보여주며, 이는 미세조정에서 안정성과 성능 향상 간의 중요한 상충관계를 드러낸다.
  • 온라인 오프폴리시 알고리즘을 사용한 미세조정 및 오프라인 데이터로 온라인 리플레이 버퍼를 초기화하는 것과 같은 단순한 수정만으로도 더 복잡한 알고리즘 개선에 비해 유사한 성능 향상을 달성할 수 있으며, 향후 연구에서 이들을 기준선으로 사용해야 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.