Skip to main content
QUICK REVIEW

[논문 리뷰] Rethinking Goal-conditioned Supervised Learning and Its Connection to Offline RL

Rui Yang, Yiming Lu|arXiv (Cornell University)|2022. 02. 09.
Reinforcement Learning in Robotics인용 수 13
한 줄 요약

이 논문은 할인된 재라벨링 가중치, 목표조건부 지수적 우월도 가중치, 최고 우월도 가중치를 조합한 복합 가중치 체계를 도입함으로써 목표조건부 지도학습(GCSL)을 향상시킨 오프라인 목표조건부 강화학습 방법인 가중치 GCSL(WGCSL)을 제안한다. WGCSL는 목표도달 목표의 더 날카운 가중치 하한을 증명적으로 최적화하고, 온라인 및 오프라인 설정 모두에서 정책 향상의 단조성(모노톤성)을 달성하며, 복잡한 로봇 조작 작업을 포함하는 새로운 벤치마크에서 GCSL 및 최첨단 오프라인 RL 방법을 능가한다.

ABSTRACT

Solving goal-conditioned tasks with sparse rewards using self-supervised learning is promising because of its simplicity and stability over current reinforcement learning (RL) algorithms. A recent work, called Goal-Conditioned Supervised Learning (GCSL), provides a new learning framework by iteratively relabeling and imitating self-generated experiences. In this paper, we revisit the theoretical property of GCSL -- optimizing a lower bound of the goal reaching objective, and extend GCSL as a novel offline goal-conditioned RL algorithm. The proposed method is named Weighted GCSL (WGCSL), in which we introduce an advanced compound weight consisting of three parts (1) discounted weight for goal relabeling, (2) goal-conditioned exponential advantage weight, and (3) best-advantage weight. Theoretically, WGCSL is proved to optimize an equivalent lower bound of the goal-conditioned RL objective and generates monotonically improved policies via an iterated scheme. The monotonic property holds for any behavior policies, and therefore WGCSL can be applied to both online and offline settings. To evaluate algorithms in the offline goal-conditioned RL setting, we provide a benchmark including a range of point and simulated robot domains. Experiments in the introduced benchmark demonstrate that WGCSL can consistently outperform GCSL and existing state-of-the-art offline methods in the fully offline goal-conditioned setting.

연구 동기 및 목표

  • 재라벨링 경험에 대한 균일한 가중치가 오프라인 설정에서 GCSL의 성능 저하를 유발하는 문제를 해결하기 위해.
  • 오프라인 목표조건부 강화학습를 위한 이론적으로 탄탄한 단조적 정책 향상 프레임워크를 구축하기 위해.
  • 목표조건부 설정에서 지도학습 기반 이mitation 학습과 오프라인 강화학습 간 격차를 메우기 위해.
  • 오프라인 목표조건부 강화학습 알고리즘 평가를 위한 다양한 복잡한 다목표 로봇 환경을 갖춘 벤치마크를 개발하기 위해.

제안 방법

  • 할인된 보상을 통합하여 GCSL의 이론적 기반을 재검토하고, 가중치가 부여된 지도학습 목표를 유도하기 위해.
  • WGCSL에 도입된 복합 가중치를 세 부분으로 구성: 목표 재라벨링을 위한 할인 가중치, 가치 함수 추정 기반의 지수적 우월도 가중치, 다중모달 데이터를 위한 최고 우월도 가중치.
  • WGCSL가 목표조건부 강화학습 목표의 등가 하한을 최적화함을 증명하여, 어떤 행동 정책을 사용하더라도 단조적 정책 향상 보장.
  • 가치 함수를 사용해 우월도를 추정하고 지수적 가중치에 영향을 주어 학습 효율성과 정책 품질 향상.
  • 가중치 기반 이mitation 체계를 오프라인 데이터셋에 적용하여, 온라인 상호작용 없이도 안정적이고 효과적인 정책 학습 가능.
  • 실제 및 합성 데이터셋을 사용한 8개 환경을 포함하는 종합적 벤치마크 설계: 포인트 매스 및 로봇 조작 작업 포함.

실험 결과

연구 질문

  • RQ1가중치 기반 이mitation 학습 프레임워크가 오프라인 목표조건부 강화학습 설정에서 GCSL의 성능 향상에 기여하는가?
  • RQ2제안된 가중치 체계가 다양한 행동 정책을 통해 단조적 정책 향상이 이루어지는가?
  • RQ3가치 기반 우월도 가중치 통합이 오프라인 목표조건부 강화학습에서 학습 효율성과 최종 성능 향상에 어떻게 기여하는가?
  • RQ4WGCSL가 복잡한 다목표 로봇 작업에서 기존 최첨단 오프라인 RL 방법을 어느 정도 능가하는가?
  • RQ5WGCSL는 인간형 손을 갖춘 다중모달성과 희소 보상 환경에 효과적으로 일반화되는가?

주요 결과

  • 제안된 벤치마크의 모든 환경에서 WGCSL는 GCSL 및 최첨단 오프라인 RL 기반 모델을 일관되게 능가하며, 특히 도전적인 HandReach 작업에서 두각을 나타낸다.
  • 인간형 손 환경에서 WGCSL는 무작위로 수집된 희소 보상 데이터셋에서 학습함에 있어 GCSL 및 다른 최첨단 방법보다 유의미하게 높은 성공률를 달성한다.
  • 최고 우월도 가중치의 도입은 다중모달 데이터 환경에서, 즉 목표에 도달하는 데 여러 유효한 경로가 존재하는 경우에 최종 성능 향상에 기여한다.
  • 복합 가중치 체계는 GCSL 대비 목표도달 목표의 더 날카운 하한을 제공하여 성능 향상의 이론적 근거를 제시한다.
  • WGCSL는 수집된 오프라인 데이터의 행동 정책에 관계없이 모든 평가 설정에서 단조적 정책 향상을 보여준다.
  • 실험 결과 가치 함수 학습이 우월도 추정에 기여함으로써 성능 향상이 비용 증가를 상회함을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.