Skip to main content
QUICK REVIEW

[논문 리뷰] Integrating Behavior Cloning and Reinforcement Learning for Improved Performance in Dense and Sparse Reward Environments

Vinicius G. Goecks, Gregory M. Gremillion|arXiv (Cornell University)|2019. 10. 09.
Reinforcement Learning in Robotics참고 문헌 35인용 수 9
한 줄 요약

이 논문은 인간의 시범을 기반으로 한 행동 클로닝(BC)과 1단계 Q-학습을 통합한 복합 손실 함수 및 이방성 사전 훈련을 통해 작동하는 액터-크리틱 강화학습 방법인 Cycle-of-Learning(CoL) 프레임워크를 제안한다. 이 방법은 밀도 높은 보상 환경과 희박한 보상 환경 모두에서 안정적이고 높은 성능의 정책 학습을 가능하게 하며, 사전 훈련 후 성능 저하 없이 최신 기술보다 빠른 훈련 속도, 높은 안정성 및 최종 성능을 달성한다.

ABSTRACT

This paper investigates how to efficiently transition and update policies, trained initially with demonstrations, using off-policy actor-critic reinforcement learning. It is well-known that techniques based on Learning from Demonstrations, for example behavior cloning, can lead to proficient policies given limited data. However, it is currently unclear how to efficiently update that policy using reinforcement learning as these approaches are inherently optimizing different objective functions. Previous works have used loss functions, which combine behavior cloning losses with reinforcement learning losses to enable this update. However, the components of these loss functions are often set anecdotally, and their individual contributions are not well understood. In this work, we propose the Cycle-of-Learning (CoL) framework that uses an actor-critic architecture with a loss function that combines behavior cloning and 1-step Q-learning losses with an off-policy pre-training step from human demonstrations. This enables transition from behavior cloning to reinforcement learning without performance degradation and improves reinforcement learning in terms of overall performance and training time. Additionally, we carefully study the composition of these combined losses and their impact on overall policy learning. We show that our approach outperforms state-of-the-art techniques for combining behavior cloning and reinforcement learning for both dense and sparse reward scenarios. Our results also suggest that directly including the behavior cloning loss on demonstration data helps to ensure stable learning and ground future policy updates.

연구 동기 및 목표

  • 샘플 비효율성과 강화학습(RL)에서의 느린 수렴 문제, 특히 탐색이 비용이 많이 들고 위험한 희박한 보상 환경에서의 문제를 해결하기 위해.
  • 성능 저하 없이 행동 클로닝(BC)에서 딥 RL로의 효율적 전이를 통해 정책 학습을 향상시키기 위해.
  • BC와 RL 손실 성분을 통합함으로써 정책 안정성과 성능에 미치는 영향을 이해하기 위해.
  • 제한된 인간 시범을 활용해 높은 초기 정책 성능를 달성하고, 이후 이방성 RL을 통해 정밀 조정하는 방법을 개발하기 위해.
  • 최소한의 인간 상호작용을 통해 실생활 로봇 시스템에서 안전하고 빠르며 안정적인 정책 향상이 가능하도록 하기 위해.

제안 방법

  • CoL 프레임워크는 액터-크리틱 아키텍처를 사용하며, 전문가 시범에 대한 행동 클로닝 손실과 에이전트가 생성한 경험에서의 1단계 Q-학습 손실을 통합한 복합 손실 함수를 적용한다.
  • 이 방법은 전문가(시범)와 에이전트가 생성한 경로의 비율을 고정하는 이방성 경험 재생 메커니즘을 활용하여 학습을 안정화하고 정책 붕괴를 방지한다.
  • 이 방법은 행동 클로닝을 통해 인간 시범에 대한 사전 훈련을 시작으로, RL 정밀 조정 동안 복합 손실의 공동 최적화를 수행한다.
  • 우선순위 기반 경험 재생(PER)의 변형도 평가되었으며, 이는 시간 차이(TD) 오차를 기반으로 전문가와 에이전트 샘플을 우선순위에 따라 정렬하여 데이터 효율성을 향상시킨다.
  • 액터와 크리틱에 공통된 신경망을 사용하는 딥 디터민리스틱 정책 그래디언트(DDPG)-스타일 알고리즘을 사용해 엔드 투 엔드로 프레임워크를 훈련한다.
  • 손실 함수는 전문가 행동에 대한 충실도를 유지하면서도 에이전트가 탐색하고 장기 수익을 최적화할 수 있도록 설계되어 있다.

실험 결과

연구 질문

  • RQ1행동 클로닝과 강화학습을 어떻게 효과적으로 융합하여 밀도 높고 희박한 보상 환경 모두에서 샘플 효율성과 학습 안정성을 향상시킬 수 있는가?
  • RQ2경험 재생 버퍼 내 전문가와 에이전트 경험의 상대 비율이 정책 성능 및 학습 안정성에 미치는 영향은 무엇인가?
  • RQ3행동 클로닝을 통한 사전 훈련 후 BC와 RL 손실을 공동 최적화하는 것이 각각의 방법을 순차적 또는 독립적으로 적용하는 것보다 더 나은 성능을 내는가?
  • RQ4경험 재생에서 전문가와 에이전트 샘플의 고정 비율을 사용할 경우, 변동성 있거나 균형이 깨진 비율 대비 정책 수렴과 성능에 어떤 영향을 미치는가?
  • RQ5제안된 방법은 자율 패러글라이더 착륙과 같은 고위험성, 고확률성 환경에서도 안정적이고 높은 성능의 정책 학습을 달성할 수 있는가?

주요 결과

  • CoL 프레임워크는 LunarLanderContinuous-v2 및 AirSim 패러글라이더 환경에서 밀도 높고 희박한 보상 환경 모두에서 최신 기술인 행동 클로닝(BC), DDPG, DAPG보다 뛰어난 성능을 보였다.
  • LunarLanderContinuous-v2의 희박한 보상 환경에서 BC와 DDPG는 500만 번의 훈련 스텝 후에도 수렴하지 못했지만, CoL은 안정적이고 높은 성능의 정책을 달성했다.
  • DAPG는 CoL보다 수렴 속도가 느렸고, 사전 훈련 후 더 낮은 성능 기반에서 시작되었지만, CoL는 성능 저하 없이 초기 BC 정책을 유지하고 향상시켰다.
  • 추상화 연구에서 경험 재생 버퍼 내 전문가와 에이전트 샘플의 고정 비율이 성능에 결정적인 영향을 미쳤으며, 단순히 BC와 RL을 순차적으로 적용하는 것만으로는 동일한 성과를 달성하지 못했다.
  • TD-오차 기반 샘플링을 사용하는 우선순위 기반 경험 재생(PER)을 적용하면 학습 효율성이 더욱 향상되었으며, 특히 AirSim과 같은 고확률성 환경에서 두드러졌다.
  • BC와 1단계 Q-학습을 통합한 복합 손실 함수는 안정적인 학습과 전문가 행동에 기반한 정책 업데이트를 보장하여 치명적인 기억 상실과 성능 붕괴를 방지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.