Skip to main content
QUICK REVIEW

[논문 리뷰] Self-Supervised Goal-Conditioned Pick and Place

Coline Devin, Payam Rowghanian|arXiv (Cornell University)|2020. 08. 26.
Robot Manipulation and Learning참고 문헌 11인용 수 4
한 줄 요약

이 논문은 인간의 레이블이 없는 피크앤플레이스 상호작용에서 피그먼트 단위 객체 임베딩을 학습하는 자기지도 학습 프레임워크를 제안한다. 이는 인간의 레이블이 없는 데이터를 사용하여 목표 조건이 붙은 그립핑과 플레이싱을 가능하게 하며, 새로운 텍스처 클래스에서 70%의 정확도를 달성한다.

ABSTRACT

Robots have the capability to collect large amounts of data autonomously by interacting with objects in the world. However, it is often not obvious \emph{how} to learning from autonomously collected data without human-labeled supervision. In this work we learn pixel-wise object representations from unsupervised pick and place data that generalize to new objects. We introduce a novel framework for using these representations in order to predict where to pick and where to place in order to match a goal image. Finally, we demonstrate the utility of our approach in a simulated grasping environment.

연구 동기 및 목표

  • 인간의 레이블이 없는 로봇 상호작용 데이터에서 시각적 객체 표현을 학습하는 자기지도 학습 방법을 개발하기 위해.
  • 인간의 세그멘테이션 또는 CAD 모델 레이블 없이 목표 조건이 붙은 그립핑과 플레이싱을 가능하게 하기 위해.
  • 로봇 상호작용에서의 픽셀 수준의 지도만을 사용하여 그립핑과 플레이싱 예측을 지원하는 통합된 임베딩 공간을 학습하기 위해.
  • 학습 중에 볼 수 없었던 새로운 물체와 텍스처로의 일반화를 평가하기 위해.
  • 특권 지도 없이도 실제 로봇 데이터를 활용한 시각적 표현 학습의 가능성을 입증하기 위해.

제안 방법

  • 모델은 두 개의 완전 컨volutional ResNet-35 인코더를 사용한다: 하나는 바구니 이미지(그립과 플레이스)용이고, 다른 하나는 그립된 물체의 손목 카메라 이미지용이다.
  • 그립 지점, 플레이스 지점, 종단 효과기 픽셀의 임베딩을 유사하게 만들고, 다른 픽셀은 멀어지도록 대비 학습을 적용한다.
  • 근접한 픽셀이 붕괴되는 것을 방지하기 위해 전체 이미지 음성 샘플링 또는 감마 분포 샘플링을 사용한다.
  • 손목-바구니 및 바구니-바구니 비교(그립:플레이스)를 포함한 통합 대비 손실을 사용하여 모델을 훈련한다.
  • 그립 및 플레이스 위치는 각 픽셀에서 손목-카메라 임베딩과 바구니 임베딩 간의 내적 곱을 최대화함으로써 예측된다.
  • 무작위 조명과 Describable Textures 데이터셋의 텍스처가 있는 물체를 사용한 시뮬레이션된 로봇 환경을 사용한다.

실험 결과

연구 질문

  • RQ1인간의 레이블 없이 자기지도 학습된 로봇 상호작용에서 피그먼트 단위 객체 임베딩을 학습할 수 있는가?
  • RQ2그러한 임베딩은 학습 중에 볼 수 없었던 새로운 물체와 텍스처로 일반화할 수 있는가?
  • RQ3그립, 플레이스 및 손목-카메라 이미지에 대한 대비 학습이 정확한 목표 조건 부여 피크 앤 플레이스를 가능하게 하는가?
  • RQ4음성 샘플링 전략이 학습된 임베딩의 품질에 어떤 영향을 미치는가?
  • RQ5단일 통합된 임베딩 공간이 목표 조건 설정에서 그립 및 플레이스 예측을 모두 지원할 수 있는가?

주요 결과

  • 학습 중에 볼 수 없었던 텍스처 클래스에서 모델은 70%의 그립 및 플레이스 정확도를 달성하여 강력한 제로샷 일반화 능력을 보였다.
  • 10개가 아닌 50개의 다른 텍스처에서 훈련하면, 볼 수 있는 텍스처를 포함한 모든 검증 세트에서 성능 향상이 이루어졌다.
  • 감마 분포 음성 샘플링과 그립:플레이스 대비 손실의 조합이 베이스라인을 능가하는 최고의 성능을 보였다.
  • 훈련 세트에서의 성능은 83%에서 시작했지만, 동일한 텍스처 검증 세트에서는 69%로 떨어졌고, 볼 수 없는 텍스처에서는 약 70%로 안정적으로 유지되었다.
  • 학습된 유사도 메트릭은 물체 내부의 공간적 위치에 매우 민감하여 정확한 그립 및 플레이스 지점 선택을 가능하게 했다.
  • 추가 데이터 수집이나 특권 정보 없이도 프레임워크는 새로운 물체와 텍스처로 일반화되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.