Skip to main content
QUICK REVIEW

[논문 리뷰] Dynamical Distance Learning for Semi-Supervised and Unsupervised Skill Discovery

Kristian Hartikainen, Xinyang Geng|arXiv (Cornell University)|2019. 07. 18.
Reinforcement Learning in Robotics인용 수 9
한 줄 요약

이 논문은 자기 수집한 경험을 바탕으로 감독 회귀를 통해 어떤 상태에서 목표 상태에 도달하는 데 필요한 평균 시간 단계 수를 측정하는 거리 함수를 학습하는 동적 거리 학습(Dynamical Distance Learning, DDL)을 제안한다. 이는 보상 함수가 없는 효율적인 스킬 탐색을 가능하게 하며, 반감독(10개의 인간 선호 레이블이 포함됨) 및 무감독 환경 모두에서 작동한다. 이로 인해 수동 보상 설계 없이도 원시 이미지에서부터 실세계의 9-도의 자유도를 가진 민감한 조작(밸브 조작)을 성공적으로 수행할 수 있다.

ABSTRACT

Reinforcement learning requires manual specification of a reward function to learn a task. While in principle this reward function only needs to specify the task goal, in practice reinforcement learning can be very time-consuming or even infeasible unless the reward function is shaped so as to provide a smooth gradient towards a successful outcome. This shaping is difficult to specify by hand, particularly when the task is learned from raw observations, such as images. In this paper, we study how we can automatically learn dynamical distances: a measure of the expected number of time steps to reach a given goal state from any other state. These dynamical distances can be used to provide well-shaped reward functions for reaching new goals, making it possible to learn complex tasks efficiently. We show that dynamical distances can be used in a semi-supervised regime, where unsupervised interaction with the environment is used to learn the dynamical distances, while a small amount of preference supervision is used to determine the task goal, without any manually engineered reward function or goal examples. We evaluate our method both on a real-world robot and in simulation. We show that our method can learn to turn a valve with a real-world 9-DoF hand, using raw image observations and just ten preference labels, without any other supervision. Videos of the learned skills can be found on the project website: https://sites.google.com/view/dynamical-distance-learning.

연구 동기 및 목표

  • 시각 기반 로봇 제어에 특히 어려운 수동 보상 함수 설계 문제를 해결한다.
  • 원시 이미지 관측치를 사용할 경우 특히 취약한 히وري스틱 보상 설계의 비효율성과 취약성을 극복한다.
  • 지도 학습이나 지도 없는 목표 상태 예측 없이도 지도 학습 및 무감독 스킬 탐색을 가능하게 한다.
  • 고차원 관측치(예: 이미지)와 표준 딥 강화학습 알고리즘에 쉽게 통합 가능한 확장성 있고 안정적인 방법을 개발한다.
  • 최소한의 인간 감독으로도 실세계 로봇 학습에서의 효과성을 입증한다.

제안 방법

  • 환경과의 자기지도적 상호작용을 통해 수집한 트레이젝터리에 기반해 감독 회귀를 통해 동적 거리를 학습한다.
  • 목표 상태까지의 예측 거리를 표준 딥 강화학습 알고리즘의 보상 신호로 활용하여 효율적인 정책 학습을 가능하게 한다.
  • 반감독 설정에서는 인간이 제공한 선호 레이블을 사용해 목표 상태를 식별하고 거리 학습을 이끌어낸다.
  • 무감독 설정에서는 가장 동적 거리가 먼 상태를 목표로 선택하여 탐색과 스킬 탐색을 이끈다.
  • 시간 차수 감독을 사용해, 어떤 상태에서라도 목표 상태에 도달하는 데 필요한 평균 단계 수를 예측하는 신경망을 훈련한다.
  • 학습된 거리 함수를 오프-폴리시 강화학습 알고리즘(SAC 등)에 통합하여 샘플 효율적인 정책 최적화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1감독 회귀를 통해 학습된 동적 거리가 복잡하고 고차원적인 환경에서 기존의 가치 기반 방법(Q-학습 등)보다 우수한 성능을 보일 수 있는가?
  • RQ2소수의 인간 선호 레이블이 실세계 로봇 조작 작업에서 효과적인 스킬 습득을 얼마나 잘 가능하게 하는가?
  • RQ3동적 거리가 먼 상태를 기반으로 한 무감독 탐색이 어떤 감독 없이도 다양하고 복잡한 이동 스킬을 발견할 수 있는가?
  • RQ4무감독 스킬 탐색에서 DDL은 DIAYN과 같은 이전 방법보다 스킬의 복잡성과 도달 가능성 측면에서 어떻게 비교되는가?
  • RQ5DDL은 원시 이미지 관측치와 최소한의 인간 피드백만으로도 실세계에서 복잡한 민감한 조작 작업을 학습할 수 있는가?

주요 결과

  • 반감독 DDL 변종은 10개의 인간 선호 레이블과 원시 이미지 관측치만을 사용해 실세계의 9-DoF 손으로 180도 밸브 조작을 성공적으로 학습했으며, 8시간 내에 작업을 완료했다.
  • Hopper-v3를 제외한 모든 작업에서 DDL은 이전의 선호 기반 강화학습 방법보다 학습 속도와 최종 성능 모두에서 뛰어난 샘플 효율성을 보였다.
  • 무감독 스킬 탐색에서 DDLUS는 DIAYN보다 훨씬 더 먼 거리만큼 원점에서 떨어진 이동 스킬을 학습했으며, 다양한 방향성 행동을 보여, 더 높은 스킬 복잡성을 시사했다.
  • 무감독 설정에서 동적 거리가 먼 상태로의 도달을 최대화함으로써 InvertedDoublePendulum-v2 작업을 성공적으로 해결했으며, 실패를 효과적으로 피했다.
  • 특히 고차원 관측 공간에서, Q-학습과 같은 근사 동적 프로그래밍 방법보다 DDL이 목표 조건 정책 학습에서 더 뛰어난 성능을 보였다.
  • 이 방법은 고차원 입력(예: 이미지)에 대해 강건하며, 수동 보상 설계나 시연 없이도 직접 실세계에 구현이 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.