Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Visuomotor Control through Distributional Planning Networks

Tianhe Yu, Gleb Shevchuk|arXiv (Cornell University)|2019. 02. 14.
Reinforcement Learning in Robotics인용 수 9
한 줄 요약

이 논문은 비감독 학습 방법인 분포 계획 네트워크(DPN)를 제안하며, 레이블이 없는 상호작용 데이터로부터 제어 중심의 거리 공간을 학습함으로써 로봇이 목표 이미지만으로도 목표 향한 진행 상황을 자율적으로 평가할 수 있도록 한다. 이 방법은 시뮬레이션 및 실제 환경의 시각-운동 작업에서 기존 비감독 접근법을 능가하며, 인간이 제공한 보상 함수 없이도 성공적인 강화 학습을 달성한다.

ABSTRACT

While reinforcement learning (RL) has the potential to enable robots to autonomously acquire a wide range of skills, in practice, RL usually requires manual, per-task engineering of reward functions, especially in real world settings where aspects of the environment needed to compute progress are not directly accessible. To enable robots to autonomously learn skills, we instead consider the problem of reinforcement learning without access to rewards. We aim to learn an unsupervised embedding space under which the robot can measure progress towards a goal for itself. Our approach explicitly optimizes for a metric space under which action sequences that reach a particular state are optimal when the goal is the final state reached. This enables learning effective and control-centric representations that lead to more autonomous reinforcement learning algorithms. Our experiments on three simulated environments and two real-world manipulation problems show that our method can learn effective goal metrics from unlabeled interaction, and use the learned goal metrics for autonomous reinforcement learning.

연구 동기 및 목표

  • 시각 기반 로봇에서 인간이 제공한 보상 함수 없이 자율적인 강화 학습을 가능하게 하기 위해.
  • 목표 향한 진행 상황을 반영하는 제어 중심의 거리 공간을 레이블이 없는 상호작용 데이터로부터 학습하기 위해.
  • 픽셀 간 거리와 밀도 기반 표현의 한계를 해결하기 위해.
  • 단일 목표 이미지만을 사용하여 다양한 조작 작업에 일반화할 수 있는 방법을 개발하기 위해.
  • 행동 결과와 일치하는 거리 공간을 학습함으로써 보다 빠르고 신뢰도 높은 RL을 가능하게 하기 위해.

제안 방법

  • 행동 시퀀스가 최종 상태에 도달하도록 이진 보상 함수를 사용하여 최적화되는 거리 공간을 학습한다.
  • 행동에 의한 상태 변화를 반영하는 분포 기반 거리 측정법을 명시적으로 최적화하여 비행동 관련 시각적 변형은 무시한다.
  • 비감독적 상호작용 데이터를 사용하여 신경망이 목표 조건에 따라 행동 시퀀스의 가능성 예측하도록 훈련한다.
  • 시뮬레이션된 전문가 시퀀스가 아닌 실제 세계의 상호작용 데이터로부터 학습함으로써 일반화된 계획 네트워크를 확장한다.
  • 목표 상태에 도달하는 시퀀스가 높은 가능성 확률을 가지도록 거리 공간을 훈련시켜 제어 중심 표현을 촉진한다.
  • 모든 행동 시퀀스가 최종 상태가 목표일 경우 최적임을 원리로 활용하여 자기 지도 학습을 가능하게 한다.

실험 결과

연구 질문

  • RQ1레이블이 없는 시각적 상호작용 데이터에서 보상 조정 없이도 의미 있는 목표 거리 측정법을 학습할 수 있는가?
  • RQ2행동 유도 상태 변화를 고려하는 제어 중심 거리 측정법이 일반적 표현 학습보다 시각-운동 제어에서 더 우수한 성능을 내는가?
  • RQ3이러한 거리 측정법이 실제 조작 작업에서 효과적이고 샘플 효율적인 강화 학습을 가능하게 하는가?
  • RQ4학습된 거리 측정법은 역모델과 오토인코더에 비해 작업 관련 시각적 특징과 간섭 요소를 어떻게 더 잘 구분하는가?
  • RQ5이 거리 측정법은 도달, 밀기, 로프 조작과 같은 다양한 작업 간에 일반화 가능한가?

주요 결과

  • DPN는 레이블이 없는 데이터와 단일 목표 이미지만을 사용하여 시뮬레이션된 도달, 밀기, 로프 조작 작업에서 자율적인 강화 학습을 성공적으로 구현하였다.
  • 실제 밀기 작업에서 DPN 거리 측정법은 객체를 목표 위치로 안정적으로 밀 수 있었고, 역모델은 잘못된 보상 조정으로 실패하였다.
  • 밀기 과정에서 후속 이미지 간 유사성을 정확히 식별한 반면, 역모델은 초기 이미지와 작은 잠재 거리 간의 오해를 유발하여 정책 학습이 열악해졌다.
  • 모의 환경과 실제 환경 실험 모두에서 최신 비감독 목표 표현 방법보다 수렴 속도가 빠르고 성공률이 높았다.
  • DPN 거리 측정법은 간섭 물체와 조명 변화를 효과적으로 간과하여 객체의 위치와 형태와 같은 작업 관련 특징에 집중하였다.
  • 다양한 카메라 각도와 시각 조건에서도 견고성을 보이며 특정 시각적 외형을 초월한 일반화 능력을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.