Skip to main content
QUICK REVIEW

[논문 리뷰] Self-Supervised Sim-to-Real Adaptation for Visual Robotic Manipulation

Rae Jeong, Yusuf Aytar|arXiv (Cornell University)|2019. 10. 21.
Domain Adaptation and Few-Shot Learning참고 문헌 42인용 수 9
한 줄 요약

이 논문은 레이블이 없는 실세계 데이터를 사용하여 시각적 로봇 조작을 위한 자기지도 학습(sim-to-real) 적응 방법을 제안한다. 시간적 대비 학습과 역학 모델링을 결합한 순서 기반 자기지도 학습, 즉 대비 전진 역학(CFD) 손실을 활용함으로써 시뮬레이션에서 현실로의 상태 표현 전이를 향상시킨다. 이 방법은 레이블이 없는 실세계 데이터 5시간만으로도 실제 큐브 스택킹 작업에서 62%의 성공률을 달성하여 도메인 랜덤라이제이션 및 도메인 적대적 방법을 뛰어넘는다.

ABSTRACT

Collecting and automatically obtaining reward signals from real robotic visual data for the purposes of training reinforcement learning algorithms can be quite challenging and time-consuming. Methods for utilizing unlabeled data can have a huge potential to further accelerate robotic learning. We consider here the problem of performing manipulation tasks from pixels. In such tasks, choosing an appropriate state representation is crucial for planning and control. This is even more relevant with real images where noise, occlusions and resolution affect the accuracy and reliability of state estimation. In this work, we learn a latent state representation implicitly with deep reinforcement learning in simulation, and then adapt it to the real domain using unlabeled real robot data. We propose to do so by optimizing sequence-based self supervised objectives. These exploit the temporal nature of robot experience, and can be common in both the simulated and real domains, without assuming any alignment of underlying states in simulated and unlabeled real images. We propose Contrastive Forward Dynamics loss, which combines dynamics model learning with time-contrastive techniques. The learned state representation that results from our methods can be used to robustly solve a manipulation task in simulation and to successfully transfer the learned skill on a real system. We demonstrate the effectiveness of our approaches by training a vision-based reinforcement learning agent for cube stacking. Agents trained with our method, using only 5 hours of unlabeled real robot data for adaptation, shows a clear improvement over domain randomization, and standard visual domain adaptation techniques for sim-to-real transfer.

연구 동기 및 목표

  • 시뮬레이션에서 훈련된 시각 기반 강화 학습 에이전트가 실제 로봇에 배포될 때 현실-시뮬레이션 갭으로 인한 일반화 능력 부족 문제를 해결하기 위해.
  • 시뮬레이션과 현실 간에 쌍화되거나 정렬된 데이터가 필요 없이, 실세계 로봇 데이터를 활용하여 sim-to-real 전이를 향상시키기 위해.
  • 모의 환경과 실제 환경에서의 로봇 경험의 시간적 구조를 활용하는 자기지도 학습 방법을 개발하기 위해.
  • 실세계의 노이즈, 가림, 해상도 변화 등으로 인한 장기 목표 조작 작업(예: 큐브 스택킹)에서 상태 표현의 강건성을 향상시키기 위해.

제안 방법

  • 두 단계 훈련 절차를 사용한다: 먼저 합성 이미지와 자세 감지 정보를 사용해 시뮬레이션에서 시각 기반 정책을 사전 훈련한 후, 레이블이 없는 실세계 로봇 데이터를 사용해 상태 표현을 적응시킨다.
  • 적응 단계에서는 순서 기반 자기지도 학습 목표—특히 대비 전진 역학(CFD) 손실—을 사용하며, 이는 시간적 일관성과 전진 역학 예측을 동시에 최적화한다.
  • CFD 손실은 관측-행동 시퀀스의 양성 및 음성 대비 쌍을 비교하여, 의미적으로 유사한 시퀀스가 잠재 공간에서 가까이 오도록 네트워크가 표현을 학습하도록 유도한다.
  • 강화 학습 목표, 상태 기반 에이전트를 모방하는 행동 복제(BC), 그리고 자기지도 학습 CFD 손실을 함께 최적화함으로써 안정적이고 효율적인 훈련을 가능하게 한다.
  • 상태 기반 에이전트와 시각 기반 에이전트 간에 공유된 리PLAY 버퍼를 사용함으로써 지식 전이가 가능해져 샘플 효율성과 훈련 안정성이 향상된다.
  • 적응 단계에서 모odal tuning을 통해 시뮬레이션 및 실세계 데이터 간의 인코더 공유를 효과적으로 보장함으로써 치명적인 잊힘 방지.

실험 결과

연구 질문

  • RQ1시뮬레이션과 현실 간에 쌍화되거나 정렬된 데이터가 없이도 순서 기반 자기지도 학습이 시각적 로봇 조작의 sim-to-real 전이를 향상시킬 수 있는가?
  • RQ2전진 역학 모델링과 시간 기반 대비 학습을 결합함으로써 실세계 로봇 데이터에서 상태 표현 학습이 어떻게 향상되는가?
  • RQ3강화 학습, 행동 복제, 자기지도 학습 목표를 함께 최적화함으로써 정책 성능과 훈련 안정성에 어떤 영향을 미치는가?
  • RQ4엔드 투 엔드 자기지도 학습 적응이 modality tuning을 통한 두 단계 훈련 절차보다 sim-to-real 전이에서 더 우수한 성능을 내는가?
  • RQ5레이블이 없는 실세계 데이터는 시각 기반 로봇 제어에서 도메인 랜덤라이제이션 또는 적대적 도메인 적응이 필요한 정도를 어느 정도 줄일 수 있는가?

주요 결과

  • 제안된 CFD 목표를 사용한 두 단계 자기지도 학습 적응은 실제 큐브 스택킹 작업에서 62%의 작업 성공률을 달성하여 도메인 랜덤라이제이션 및 도메인 적대적 신경망(DANN)을 뛰어넘었다.
  • TCN 손실을 사용한 엔드 투 엔드 자기지도 학습 적응은 인코더 공유가 부족하여 성능이 떨어졌으며, 이는 두 단계 훈련 과정에서 모달리티 튜닝의 중요성을 입증한다.
  • 강화 학습 목표, 행동 복제, 자기지도 학습 CFD 손실을 함께 최적화하는 것이 필수적이었으며, 자기지도 학습 손실만 최적화할 경우 치명적인 잊힘과 작업 성능 붕괴가 발생했다.
  • 상태 기반 에이전트와 시각 기반 에이전트 간에 공유된 리PLAY 버퍼를 사용함으로써 훈련 속도와 안정성이 향상되었으며, 특히 복잡한 장기 목표 작업에서 두드러졌다.
  • 시각 기반 에이전트에 행동 복제 목표를 추가하면 학습 속도가 크게 향상되었고, 자기지도 학습 목표와 함께 훈련할 때도 성능 유지가 가능했다.
  • 절단 실험 결과, 시간적 구조와 행동 조건화 역학을 모두 활용하는 CFD 손실이, TCN 또는 DANN과 같은 단순한 자기지도 학습 목표보다 이 작업에 더 효과적임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.