Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Goal-Conditioned Policies Offline with Self-Supervised Reward Shaping

Lina Mezghani, Sainbayar Sukhbaatar|arXiv (Cornell University)|2023. 01. 05.
Intelligent Tutoring Systems and Adaptive Learning인용 수 4
한 줄 요약

이 논문은 인간이 설계한 보상 없이 사전에 수집된 트랙토리에서 조밀한 보상을 학습하는 자기지도 학습 보상 형상화 방법을 제안한다. 도달 가능성 네트워크를 훈련하고, 대표적인 상태를 추출하며, 상태공간 그래프를 구축함으로써 장기 환경에서의 정책 학습을 효율적으로 가능하게 한다. 이 방법은 연속 제어 작업, 예를 들어 UMaze, RoboYoga Walker, Pusher에서 이전의 후행 재라벨링 기반 방법들보다 뚜렷이 뛰어난 성능을 보인다.

ABSTRACT

Developing agents that can execute multiple skills by learning from pre-collected datasets is an important problem in robotics, where online interaction with the environment is extremely time-consuming. Moreover, manually designing reward functions for every single desired skill is prohibitive. Prior works targeted these challenges by learning goal-conditioned policies from offline datasets without manually specified rewards, through hindsight relabelling. These methods suffer from the issue of sparsity of rewards, and fail at long-horizon tasks. In this work, we propose a novel self-supervised learning phase on the pre-collected dataset to understand the structure and the dynamics of the model, and shape a dense reward function for learning policies offline. We evaluate our method on three continuous control tasks, and show that our model significantly outperforms existing approaches, especially on tasks that involve long-term planning.

연구 동기 및 목표

  • 사전에 수집된 데이터셋에서 보상 설계 없이 오프라인, 비지도 학습을 통해 다중 작업 목표 조건화 정책을 학습하는 것.
  • 기존 오프라인 RL 방법에서 정책 학습을 방해하는 희박한 보상 문제를 해결하는 것.
  • 트랙토리에서 환경의 동역학과 구조를 학습하여 조밀하고 의미 있는 보상을 형상화하는 자기지도 학습 단계를 개발하는 것.
  • 전문가 지시 없이 낮은 품질의 데이터셋, 예를 들어 무작위 정책으로 수집된 데이터셋에서도 효과적인 정책 훈련을 가능하게 하는 것.
  • 모든 단계에서 추가적인 환경 상호작용이나 수동으로 설계된 보상 함수가 필요 없도록 하는 것.

제안 방법

  • 오프라인 데이터셋의 전이를 사용하여 상태공간 내 국소적 거리를 추정하는 도달 가능성 네트워크를 훈련한다.
  • 상태공간을 덮는 데 사용할 수 있는 대표적인 상태 집합을 추출하여 전역 거리 근사의 기준점으로 삼는다.
  • 대표 상태들 간의 그래프를 구성하여 최단경로 계산을 통해 상태공간 내 전역 거리를 모델링한다.
  • 목표까지의 최단경로 거리를 기반으로 정책 훈련 중에 조밀한 보상을 생성한다.
  • 정책 일반화 및 훈련 안정성을 향상시키기 위해 그래프 경로를 따라 중간 전이를 데이터셋에 보강한다.
  • 보상 함수나 환경 상호작용 없이 자기지도 학습된 조밀한 보상과 보강된 전이를 사용해 목표 조건화 정책을 훈련한다.

실험 결과

연구 질문

  • RQ1오프라인 트랙토리에서 자기지도 표현 학습이 인간이 설계한 보상 없이도 조밀한 보상 형상화를 가능하게 할 수 있는가?
  • RQ2조밀한 보상 형상화가 장기 환경에서의 목표 조건화 제어 작업에서 학습 효율성과 성능을 향상시키는가?
  • RQ3무작위 정책으로 수집된 낮은 품질의 데이터셋에서도 효과적인 정책을 학습할 수 있는가?
  • RQ4HER 및 Actionable Models과 같은 후행 재라벨링 기반 방법들과 비교해 본다면, 제안된 방법은 오프라인 목표 조건화 RL에서 어떻게 성능을 내는가?
  • RQ5데이터 수집 또는 훈련 단계에서 보상 감독 없이도 복잡한 연속 제어 환경으로 일반화 가능한가?

주요 결과

  • UMaze 작업에서 제안된 방법은 HER 및 Actionable Models을 뚜렷이 뛰어넘으며, 초기 상태에서 멀리 떨어진 목표에 대해서도 성능이 뛰어나 장기 환경에서의 계획 능력 향상을 입증한다.
  • RoboYoga Walker 작업에서 제안된 방법은 베이스라인보다 뛰어난 성능을 달성했고, Actionable Models은 표준 HER에 비해 향상되지 못해 더 높은 샘플 효율성과 일반화 능력을 보여준다.
  • Pusher 작업에서 제안된 방법은 모든 베이스라인보다 평균 거리, 손 거리, 퍼크 거리가 낮아 정밀하고 순차적인 제어 능력을 보여준다.
  • 무작위 정책으로 수집된 데이터셋에서도 효과적인 정책을 학습할 수 있어 낮은 품질의 데이터에 대한 강건성을 입증하고 전문가 지시의 필요성을 제거한다.
  • 그래프 기반의 조밀한 보상 형상화로 인해 희박한 보상 방법보다 더 빠른 수렴과 더 안정적인 훈련이 가능했으며, 특히 복잡한 환경에서 두드러진다.
  • 이 방법은 데이터 수집, 훈련, 평가 단계에서 어떤 보상 함수도 필요 없이 완전히 비지도 오프라인 목표 조건화 정책 학습을 가능하게 하는 최초의 방법이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.