Skip to main content
QUICK REVIEW

[논문 리뷰] Form2Fit: Learning Shape Priors for Generalizable Assembly from Disassembly

Kevin Zakka, Andy Zeng|arXiv (Cornell University)|2019. 10. 30.
Robot Manipulation and Learning참고 문헌 36인용 수 14
한 줄 요약

Form2Fit는 Siamese 컨volution 네트워크를 사용하여 물체 표면과 목표 배치 위치 간의 기하학적 대응 관계를 학습함으로써 일반화 가능한 로봇 키트 조립을 위한 자기지도 학습, 형태 매칭 기반 접근법을 제안한다. 시스템은 3D CAD 모델이나 작업별 특화 튜닝 없이도 다양한 초기 조건에서 90%의 성공률, 새로운 키트 구성에서 94%의 성공률, 그리고 새로운 물체와 키트에 대해 86% 이상의 일반화 성능를 기록한다. 이는 분해 과정에서 생성된 훈련 데이터를 활용하여 제로샷 전이를 가능하게 한다.

ABSTRACT

Is it possible to learn policies for robotic assembly that can generalize to new objects? We explore this idea in the context of the kit assembly task. Since classic methods rely heavily on object pose estimation, they often struggle to generalize to new objects without 3D CAD models or task-specific training data. In this work, we propose to formulate the kit assembly task as a shape matching problem, where the goal is to learn a shape descriptor that establishes geometric correspondences between object surfaces and their target placement locations from visual input. This formulation enables the model to acquire a broader understanding of how shapes and surfaces fit together for assembly -- allowing it to generalize to new objects and kits. To obtain training data for our model, we present a self-supervised data-collection pipeline that obtains ground truth object-to-placement correspondences by disassembling complete kits. Our resulting real-world system, Form2Fit, learns effective pick and place strategies for assembling objects into a variety of kits -- achieving $90\%$ average success rates under different initial conditions (e.g. varying object and kit poses), $94\%$ success under new configurations of multiple kits, and over $86\%$ success with completely new objects and kits.

연구 동기 및 목표

  • 3D CAD 모델이나 작업별 특화 훈련 데이터 없이도 새로운 물체와 키트에 대해 일반화 가능한 로봇 조립을 가능하게 하는 것.
  • 정확한 6자리 물체 자세 추정에 크게 의존하고 새로운 구성에 대해 일반화하지 못하는 자세 기반 조립 방법의 한계를 해결하는 것.
  • 완성된 키트의 분해 궤적을 뒤집음으로써 자율적인 시도-오류 기반 픽업-장착 동작을 통해 고품질의 훈련 데이터를 생성하는 자기지도 학습 데이터 수집 파이프라인을 개발하는 것.
  • 종합적인 훈련을 통해 물체와 그 목표 배치 위치 간의 기하학적 대응 관계를 인코딩하는 일반화 가능한 형태 기술자(Shape Descriptor)를 학습하는 것.
  • 실세계 환경에서 다양한 초기 조건, 다중 키트 구성, 그리고 훈련 중에 보지 못한 물체와 키트에 대해 시스템의 강인성과 일반화 능력을 평가하는 것.

제안 방법

  • Form2Fit는 키트 조립 문제를 형태 매칭 문제로 재정의하여, 완전 컨volution 네트워크 기반의 시아모이즈(Siamese) 네트워크를 통해 픽셀 단위의 특징 기술자를 학습함으로써 물체 표면을 목표 배치 위치와 매칭한다.
  • 네트워크는 대조 손실(contrastive loss)을 사용하여 시아모이즈 방식으로 훈련되며, 참조 대응 관계에 대해 유사한 기술자를 유도하고 일반화 성능 향상을 위한 정규화를 적용한다.
  • 자기지도 학습 데이터 수집 파이프라인은 자율적인 분해 과정을 통해 완성된 키트를 시도-오류 방식의 픽업-장착 동작으로 분해한 후, 동작 순서를 뒤집어 진짜 운동 궤적과 대응 관계를 확보한다.
  • 훈련 데이터는 실제 키트의 분해 과정에서 수집되며, 이는 다양한 물체와 키트 기하학적 형태에 걸쳐 광범위한 형태 사전 지식을 학습할 수 있도록 한다.
  • 시스템은 RGB-D 관측을 사용하여 고도맵을 생성하고, 이를 네트워크에 입력하여 매칭을 위한 공간적으로 정렬된 기술자를 예측한다.
  • 추론 단계에서는 기술자 유사도가 가장 높은 물체-장착 위치 쌍을 선택하여 최적의 픽업-장착 동작을 결정한다.

실험 결과

연구 질문

  • RQ13D CAD 모델이나 작업별 특화 훈련 데이터 없이도 새로운 물체와 키트에 대해 일반화 가능한 로봇 조립 정책을 학습할 수 있는가?
  • RQ2다양한 키트 조립 작업에서 학습된 형태 사전 지식이 새로운 구성 및 기하학적 형태에 대해 얼마나 효과적으로 일반화되는가?
  • RQ3인간의 지시나 스크립트 기반 정책이 아닌 자기지도 학습을 통한 분해를 통해 고품질의 대규모 훈련 데이터를 생성하는 것이 가능한가?
  • RQ4시스템은 물체와 키트의 자세에 대한 다양한 변형, 예를 들어 다양한 회전과 이동에 대해 얼마나 강인한가?
  • RQ5훈련 중에 보지 못한 다수의 키트 조합과 완전히 새로운 물체에 대해서도 시스템은 일반화 가능한가?

주요 결과

  • 다양한 초기 조건, 즉 무작위 물체 및 키트 자세와 방향을 포함한 단일 및 다중 물체 키트에 대해 평균 90%의 성공률 기록.
  • 다양한 키트의 혼합 조합을 포함한 새로운 구성에서는 94.27%의 성공률를 기록하여, 새로운 키트 배열에 대한 강력한 일반화 능력을 입증.
  • 훈련 중에 보지 못한 완전히 새로운 물체와 키트에 대해서는 86% 이상의 성공률를 기록하여, 새로운 기하학적 형태에 대한 효과적인 제로샷 일반화 능력을 입증.
  • t-SNE 시각화 결과는 학습된 기술자가 회전, 공간적 대응, 물체 정체성을 모두 인코딩하고 있음을 확인하여, 모델이 물체 변형에 대해 일반화할 수 있음을 뒷받침.
  • 실패 원인은 주로 180도 자세 뒤집힘 또는 기하학적으로 유사한 물체들(예: 레몬과 딸기)의 혼동으로 인한 것으로, 저해상도 관측 조건에서의 형태 식별 능력의 한계를 시사.
  • 자기지도 학습 기반 분해 파이프라인은 자율적 분해 과정에서의 동작 순서를 뒤집어 고품질의 훈련 데이터를 성공적으로 생성하였으며, 인간의 주석 없이도 확장 가능한 데이터 수집을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.