Skip to main content
QUICK REVIEW

[논문 리뷰] Model-based Behavioral Cloning with Future Image Similarity Learning

Alan H.B. Wu, AJ Piergiovanni|arXiv (Cornell University)|2019. 10. 08.
Reinforcement Learning in Robotics참고 문헌 37인용 수 6
한 줄 요약

이 논문은 전문가 트레이젝터리만을 사용하여 확률적이고 동작 조건화된 미래 이미지 예측 모델을 학습하는 모델 기반 행동 복제 프레임워크를 제안한다. 이는 전문가 결과와 가장 유사한 미래 이미지를 생성하는 동작을 선택함으로써 제로샷 정책 학습을 가능하게 한다. 이 방법은 실세계 로봇 목표 접근 작업에서 94%의 성공률을 기록했으며, 이는 이전 방법보다 2.5배 높은 성능이다. 이는 실세계 시험 데이터 없이도 시각적 미래 예측과 유사도 학습을 활용한 결과이다.

ABSTRACT

We present a visual imitation learning framework that enables learning of robot action policies solely based on expert samples without any robot trials. Robot exploration and on-policy trials in a real-world environment could often be expensive/dangerous. We present a new approach to address this problem by learning a future scene prediction model solely on a collection of expert trajectories consisting of unlabeled example videos and actions, and by enabling generalized action cloning using future image similarity. The robot learns to visually predict the consequences of taking an action, and obtains the policy by evaluating how similar the predicted future image is to an expert image. We develop a stochastic action-conditioned convolutional autoencoder, and present how we take advantage of future images for robot learning. We conduct experiments in simulated and real-life environments using a ground mobility robot with and without obstacles, and compare our models to multiple baseline methods.

연구 동기 및 목표

  • 실세계에서 정책 학습을 위해 실세계 시험 데이터 없이 제한된 전문가 시범만을 사용하는 것.
  • 행동 복제에서의 공변수 이탈 문제를 해결하기 위해 학습된 미래 예측 모델을 활용해 예상치 못한 상태로 일반화하는 것.
  • 동작 선택을 위한 평가자로 시각적 미래 이미지 유사도를 활용하여 임의화 학습을 향상시키는 것.
  • 비전 상태 전이 모델의 일반화 능력을 활용해 비전문가 동작과 예상치 못한 상태로 일반화되는 확률적이고 동작 조건화된 컨volutional autoencoder를 개발하는 것.
  • 객체 레이블링이나 보상 신호 없이도 실세계 및 시뮬레이션 환경에서 높은 성능을 달성하는 것.

제안 방법

  • 확률적 동작 조건화 컨volutional autoencoder가 전문가 트레이젝터리만을 사용하여 현재 관측값과 동작에서 미래 이미지를 예측하도록 훈련된다.
  • 모델은 확률적 사전 분포를 추정하기 위해 순환 신경망(LSTM)을 사용하여 확률적 환경에서의 강인성을 향상시킨다.
  • 미래 이미지 유사도 네트워크가 함께 훈련되어 예측된 미래 이미지가 전문가가 제공한 미래 이미지와 얼마나 유사한지 평가한다.
  • 행동 정책는 예측된 미래 이미지와 전문가의 미래 이미지 간의 유사도를 최대화하는 동작을 선택함으로써 유도되며, 이는 학습된 평가자로 기능한다.
  • 이 프레임워크는 제로 시험 설정에서 작동하며, 추가적인 실세계 상호작용 없이 전문가 영상과 동작 쌍만을 기반으로 한다.
  • 학습된 상태 전이 모델의 일반화 능력을 활용하여 예상치 못한 상태와 동작으로 일반화된다.

실험 결과

연구 질문

  • RQ1전문가 트레이젝터리만으로 훈련된 미래 이미지 예측 모델이 비전문가 동작과 예상치 못한 상태로 일반화될 수 있는가?
  • RQ2미래 이미지 유사도를 통합함으로써 제로트라이얼 임의화 학습에서 행동 복제 성능이 어떻게 향상되는가?
  • RQ3예측 모델의 확률적 사전 분포가 실세계 환경에서 시각적 미래 예측 품질을 향상시키는가?
  • RQ4제안된 방법이 실세계 및 시뮬레이션 환경에서 표준 행동 복제 및 기준 기반 임의화 학습 방법보다 얼마나 뛰어나게 성능을 내는가?
  • RQ5실세계 환경에서 방해 요소가 있는 경우나 목표물이 표시되지 않은 경우 이 방법의 내성은 어느 정도인가?

주요 결과

  • 제안된 방법은 실세계 로봇 목표 접근 작업에서 94%의 성공률을 기록했으며, 이는 다음으로 높은 베이스라인 대비 2.5배 높은 성능이다.
  • 장애물 회피 시뮬레이션에서는 확률적 모델을 사용해 63%의 성공률을 기록했으며, 이는 결정론적 및 행동 복제 기반 베이스라인보다 뚜렷이 뛰어나다.
  • 확률적 상태 모델은 모든 방법 중에서 가장 낮은 DTW 유사도 점수 5.98을 기록하여 전문가 시범과 높은 궤적 유사도를 보였다.
  • 방해 요소가 있는 환경에서도 이 방법은 방해 요소를 간과하고 목표지점으로 이동했으며, 객체 레이블링 없이도 DTW 점수 4.94를 기록했다.
  • 미래 이미지 유사도 모델은 효과적인 제로샷 정책 학습을 가능하게 했으며, 전문가 질의 없이도 예상치 못한 상태와 동작으로 잘 일반화되었다.
  • autoencoder에 확률적 사전 분포를 도입함으로써 이미지 생성 품질이 향상되었고, 이는 더 나은 정책 일반화에 기여했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.