Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Rope Manipulation Policies Using Dense Object Descriptors Trained on Synthetic Depth Data

Priya Sundaresan, Jennifer Grannen|arXiv (Cornell University)|2020. 03. 03.
Robot Manipulation and Learning참고 문헌 37인용 수 16
한 줄 요약

이 논문은 합성 깊이 이미지로만 훈련된 조밀한 깊이 물체 기술자(DDOD)를 사용하여 해석 가능하고 이식 가능한绳 조작 정책을 학습하는 방법을 제안한다. 시뮬레이션에서 초기 상태와 목표 상태의 점 쌍 대응 관계를 학습함으로써, 비디오 시연로부터의 모방 학습과 기하학적 정책 학습을 모두 가능하게 하여, 기존에 본 적이 없는 구성으로부터 실제 ABB YuMi 로봇에서 매듭 묶기 작업에서 66%의 성공률을 달성한다.

ABSTRACT

Robotic manipulation of deformable 1D objects such as ropes, cables, and hoses is challenging due to the lack of high-fidelity analytic models and large configuration spaces. Furthermore, learning end-to-end manipulation policies directly from images and physical interaction requires significant time on a robot and can fail to generalize across tasks. We address these challenges using interpretable deep visual representations for rope, extending recent work on dense object descriptors for robot manipulation. This facilitates the design of interpretable and transferable geometric policies built on top of the learned representations, decoupling visual reasoning and control. We present an approach that learns point-pair correspondences between initial and goal rope configurations, which implicitly encodes geometric structure, entirely in simulation from synthetic depth images. We demonstrate that the learned representation -- dense depth object descriptors (DDODs) -- can be used to manipulate a real rope into a variety of different arrangements either by learning from demonstrations or using interpretable geometric policies. In 50 trials of a knot-tying task with the ABB YuMi Robot, the system achieves a 66% knot-tying success rate from previously unseen configurations. See https://tinyurl.com/rope-learning for supplementary material and videos.

연구 동기 및 목표

  • 끈과 같은 높은 유연성의 1차원 물체 조작에 있어, 높은 차원의 구성 공간과 자기 음영 및 자기 유사성으로 인한 인식 어려움 문제를 해결하기 위해.
  • 실제 데이터 수집의 비용을 줄이기 위해, 합성 깊이 이미지로만 훈련된 시각적 표현을 사용하여 실세계 데이터 의존도를 감소시키기 위해.
  • 시각적 인식과 제어 정책 학습을 분리하여, 해석 가능하고 이식 가능한 기하학적 정책를 가능하게 하기 위해.
  • 단일 비디오 시범 또는 기하 알고리즘만으로도 복잡한 평면 및 비평면 구성의 끈 조작을 가능하게 하기 위해.
  • 학습된 조밀한 깊이 물체 기술자(DDOD)를 통해 기존에 본 적이 없는 끈 구성으로도 견고한 일반화를 달성하기 위해.

제안 방법

  • 끈 구성의 합성 깊이 이미지와 레이블된 대응 관계를 사용하여 3D 또는 16D의 조밀한 깊이 물체 기술자(DDOD) 네트워크를 훈련하며, 실제 환경으로의 이식을 향상시키기 위해 노이즈 주입을 포함한다.
  • 시뮬레이션에서 초기 상태와 목표 상태의 점 쌍 대응 관계를 학습하여 정확한 동역학 시뮬레이션을 필요로 하지 않는 방식으로 기하학적 구조를 암묵적으로 인코딩한다.
  • 실제 이미지와 목표 이미지 간의 교차율(IoU) 기반 손실 함수를 최소화하여 DDOD를 사용해 비디오 시범을 추적하며, 끈 곡선의 이동과 회전을 통한 정렬을 수행한다.
  • DDOD를 사용해 루프와 끝점의 대응 관계를 식별하고 순차적 동작를 안내하는 기하학적 정책를 설계하여 매듭 묶기 작업을 수행한다.
  • 학습된 표현을 실제 ABB YuMi 로봇에 적용하여 그립퍼를 사용해 모방 정책과 기하학적 정책를 모두 실행한다.
  • 매개변수 곡선을 끈 점에 피팅한 후 이동과 회전에 대해 최적화된 제곱오차 합을 계산하는 손실 함수를 사용해 성능을 평가한다.

실험 결과

연구 질문

  • RQ1합성 깊이 데이터로 훈련된 조밀한 물체 기술자가 실세계 데이터 없이도 효과적이고 해석 가능한 끈 조작 정책를 가능하게 할 수 있는가?
  • RQ2학습 시뮬레이션에서만 훈련된 DDOD가 비평면 배열을 포함한 다양한 끈 구성으로 일반화될 수 있는가?
  • RQ3학습된 DDOD 기반 기하학적 정책가 기존에 본 적이 없는 시작 상태에서 복잡한 작업인 매듭 묶기에서 높은 성공률를 달성할 수 있는가?
  • RQ4이러한 방법의 성능가 이른바 광범위한 실세계 데이터 수집을 요구하는 기존의 학습 기반 접근법과 비교해 어떻게 되는가?
  • RQ5DDOD가 작업에 종속되지 않고 이식 가능한 정책를 지원하는 데 얼마나 효과적인가? 이 정책들은 해석 가능하고 실세계 조작에서 효과적인가?

주요 결과

  • 시스템은 50개의 기존에 본 적이 없는 끈 구성에서 ABB YuMi 로봇을 사용해 매듭을 묶는 데 66%의 성공률를 달성하였으며, 유사 조건에서 기존 방법보다 높은 성공률를 기록하였다.
  • 이 방법은 단일 비디오 시범을 사용하여 DDOD 기반의 시각적 대응 매칭을 통해 평면 및 비평면 끈 조작 시퀀스를 성공적으로 추적하고 반복하였다.
  • 실패 분석 결과, 실패의 16%는 잘못된 끝점 또는 루프 점 대응 관계로 인한 것이었으며, 12%는 당길 때 끝점의 음영으로 인한 것이었다.
  • 훈련 시 노이즈가 주입된 합성 데이터의 사용이 실세계 끈 조작으로의 효과적 이식을 가능하게 하여 도메인 격차를 감소시켰다.
  • 매듭 묶기의 기하학적 정책는 DDOD가 실세계 데이터에서의 종단 간 훈련 없이도 복잡한 다단계 조작 작업을 지원할 수 있음을 보여주었다.
  • 이 방법은 인식과 제어를 분리함으로써, 기하학적으로 구조화되고 작업 간 이식 가능한 해석 가능한 정책를 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.