[논문 리뷰] Learning Sparse Rewarded Tasks from Sub-Optimal Demonstrations
이 논문은 자기적응형 이mitation 학습(SAIL)을 제안한다. SAIL은 오프-폴리시 이mitation 학습 방법으로, 전문가가 제공한 시연 데이터와 자기 생성된 궤적을 결합하여 희박한 보상 환경에서 높은 샘플 효율성을 달성하고, 열등한 교사 정책을 초월한다. SAIL는 탐색 중심의 동적 목적함수를 사용하여 이mitation과 탐색을 균형 잡으며, 판별기 기반의 합성 보상 신호를 이용해 열등한 시연를 반복적으로 자기 생성된 보다 우수한 궤적들로 교체함으로써 연속 제어 벤치마크에서 거의 최적의 성능을 달성한다.
Model-free deep reinforcement learning (RL) has demonstrated its superiority on many complex sequential decision-making problems. However, heavy dependence on dense rewards and high sample-complexity impedes the wide adoption of these methods in real-world scenarios. On the other hand, imitation learning (IL) learns effectively in sparse-rewarded tasks by leveraging the existing expert demonstrations. In practice, collecting a sufficient amount of expert demonstrations can be prohibitively expensive, and the quality of demonstrations typically limits the performance of the learning policy. In this work, we propose Self-Adaptive Imitation Learning (SAIL) that can achieve (near) optimal performance given only a limited number of sub-optimal demonstrations for highly challenging sparse reward tasks. SAIL bridges the advantages of IL and RL to reduce the sample complexity substantially, by effectively exploiting sup-optimal demonstrations and efficiently exploring the environment to surpass the demonstrated performance. Extensive empirical results show that not only does SAIL significantly improve the sample-efficiency but also leads to much better final performance across different continuous control tasks, comparing to the state-of-the-art.
연구 동기 및 목표
- 희박한 보상 환경에서 제한된 열등한 전문가 시연 데이터만을 이용해 강화학습 에이전트를 훈련시키는 데 도전하는 것.
- 높은 품질의 또는 최적의 전문가 데이터가 필요 없이 전문가 시연 데이터를 활용하여 모델-프리 강화학습의 샘플 복잡도를 줄이는 것.
- 희박한 환경 보상 신호에 기반한 체계적인 탐색을 통해 에이전트가 열등한 시연의 성능을 초월하도록 하는 것.
- 시연 행동의 이mitation과 더 높은 수익을 얻는 새로운 궤적 탐색 사이의 동적 균형을 이루는 학습 목적함수를 설계하는 것.
제안 방법
- SAIL는 과거 정책에서의 과도한 피팅을 방지하기 위해 분포 매칭과 함께 이전 정책에서의 탐색 중심의 이탈을 조합하는 이중 목적 학습 과정을 제안한다.
- 전문가 시연와 자기 생성된 궤적 간의 점유도 측정치 일치를 바탕으로 판별기가 합성 보상 신호를 생성하여, 진짜 환경 보상에 접근할 수 없더라도 보상 형상화를 가능하게 한다.
- SAIL는 오프-폴리시 액터-크리틱 프레임워크를 사용하여 전문가 시연와 자기 생성된 경험을 모두 효율적으로 활용하며, 분포 이탈을 보정하기 위해 중요도 샘플링을 적용한다.
- SAIL는 희박한 보상에 기반하여 열등한 시연를 더 높은 수익을 얻는 자기 생성된 궤적들로 선택적이고 동적으로 교체하는 메커니즘을 구현한다.
- 알고리즘은 현재 교사 분포에 대한 이mitation과 더 나은 정책를 발견하기 위한 탐색을 번갈아 수행함으로써 타겟 정책을 반복적으로 향상시킨다.
- 정책 목적함수를 정의하기 위해 정규화된 정적 상태-행동 분포 $ d_{\pi} $ 를 활용하며, 초기 훈련 단계에서 전문가 시연를 자연스럽게 우선시하는 형상화된 보상 함수를 사용한다.
실험 결과
연구 질문
- RQ1열등한 전문가 시연 데이터만 존재할 경우, 이mitation 학습 방법이 거의 최적의 성능을 달성할 수 있는가?
- RQ2밀도 높은 보상 신호에 의존하지 않고도 희박한 보상 환경에서 탐색을 효과적으로 이끌 수 있는가?
- RQ3시연 행동의 이mitation과 새로운 높은 수익 궤적 탐색 사이의 최적의 트레이드오프는 무엇인가?
- RQ4더 뛰어난 자기 생성 궤적들로 열등한 시연를 동적으로 적응적으로 교체하는 것이 교사 정책의 성능을 초월하는 데 기여하는가?
- RQ5오프-폴리시 이mitation 학습을 더 샘플 효율적으로 만들면서도 열등한 품질의 시연 데이터에 대해 강건성을 유지할 수 있는가?
주요 결과
- SAIL는 희박한 보상 환경에서 연속 제어 작업에 대해 최신 기술 대비 뚜렷한 샘플 효율성 향상을 보였다.
- 제한된 수의 열등한 시연 데이터만 존재할 경우에도 SAIL는 교사 정책의 성능을 초월하여 거의 최적의 성능을 달성했다.
- 다양한 벤치마크 환경에서 SAIL는 기존의 이mitation 학습 및 강화학습 기준선보다 최종 점수에서 뛰어난 성능을 보였다.
- 높은 수익을 얻는 자기 생성 궤적들로의 시연 교체가 시간이 지남에 따라 일관된 성능 향상을 이끌었다.
- 판별기 기반의 합성 보상 사용은 진짜 환경 보상에 접근할 수 없더라도 효과적인 탐색을 가능하게 했다.
- 실험 결과 SAIL는 표준 IL 방법들과 달리 열등한 시연 데이터로 인한 성능 저하 없이 안정적인 훈련을 유지함을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.