Skip to main content
QUICK REVIEW

[논문 리뷰] Siamese Convolutional Neural Network for Sub-millimeter-accurate Camera Pose Estimation and Visual Servoing

Cunjun Yu, Zhongang Cai|arXiv (Cornell University)|2019. 03. 12.
Advanced Vision and Imaging참고 문헌 16인용 수 8
한 줄 요약

이 논문은 산업용 로봇 조립 작업에서 매우 정밀한 시각 서보 제어를 가능하게 하는 0.5mm 이내 정확도의 카메라 자세 추정을 위한 시아모이즈 컨volution 신경망을 제안한다. 두 이미지 쌍 간의 상대 자세를 시아모이즈 아키텍처를 사용해 추정함으로써, 초기 오차 10 mm/5°를 단일 추론에서 0.6 mm/0.4° 이내로 감소시켜, 힘 감지 장치 없이도 VGA 커넥터 삽입 작업에서 97.5%의 성공률을 달성한다.

ABSTRACT

Visual Servoing (VS), where images taken from a camera typically attached to the robot end-effector are used to guide the robot motions, is an important technique to tackle robotic tasks that require a high level of accuracy. We propose a new neural network, based on a Siamese architecture, for highly accurate camera pose estimation. This, in turn, can be used as a final refinement step following a coarse VS or, if applied in an iterative manner, as a standalone VS on its own. The key feature of our neural network is that it outputs the relative pose between any pair of images, and does so with sub-millimeter accuracy. We show that our network can reduce pose estimation errors to 0.6 mm in translation and 0.4 degrees in rotation, from initial errors of 10 mm / 5 degrees if applied once, or of several cm / tens of degrees if applied iteratively. The network can generalize to similar objects, is robust against changing lighting conditions, and to partial occlusions (when used iteratively). The high accuracy achieved enables tackling low-tolerance assembly tasks downstream: using our network, an industrial robot can achieve 97.5% success rate on a VGA-connector insertion task without any force sensing mechanism.

연구 동기 및 목표

  • 산업용 로봇 조립 작업을 위한 고정도, 일반화 능력, 내구성이 뛰어난 시각 서보 제어 방법의 부족을 해결하기 위해.
  • 기존의 딥 러닝 기반 시각 서보 제어의 한계, 즉 일반화 능력 부족, 조명 변화에 대한 민감성, 실제 데이터에서의 높은 오차율을 극복하기 위해.
  • 큰 初기 자세 오차가 있는 상황에서도 반복적으로 적용해도 0.5mm 이내 정확도를 유지할 수 있는 자세 추정 네트워크를 개발하기 위해.
  • 힘 감지 장치 없이도 시각 피드백만으로도 고정도의 로봇 삽입 작업을 수행할 수 있도록 하기 위해.
  • 유사한 훈련 예제로부터의 일반화를 통해 새로운 커넥터, 부분적 가림, 조명 조건 변화에 대해 내구성을 확보하기 위해.

제안 방법

  • 두 개의 동일한 공유 가중치 특징 추출기로 구성된 시아모이즈 CNN 아키텍처가 두 입력 이미지를 각각 독립적으로 처리한다.
  • 각 이미지의 특징은 이후 계층에서 상관 기반 유사도 모듈을 사용해 비교되어 상대 자세 차이를 추정한다.
  • 미세한 자세 회귀를 학습하기 위해, 작은 자세 차이(≤10 mm 이동, ≤5° 회전)를 가진 합성 이미지 쌍으로 네트워크를 훈련시킨다.
  • 자세 추정은 한 번의 추론으로 수행되며, 현재 이미지를 기준 이미지에 정렬하기 위해 필요한 변환을 예측한다.
  • 큰 초기 오차가 있는 경우, 네트워크는 반복적으로 적용되며, 각 예측 결과가 로봇의 자세를 개선하여 수렴할 때까지 반복한다.
  • 훈련 데이터셋은 로봇 장치를 사용해 제어된 정확한 자세에서 레이블이 부여된 이미지 쌍을 자동으로 촬영하여 수집된다.

실험 결과

연구 질문

  • RQ1시아모이즈 CNN은 로봇 시각 서보 제어를 위한 상대 카메라 자세 추정에서 0.5mm 이내 정확도를 달성할 수 있는가?
  • RQ2훈련 중에 보지 못한 새로운 커넥터에 대해 네트워크가 일반화되면서도 높은 정확도를 유지할 수 있는가?
  • RQ3반복적으로 적용할 경우, 조명 변화, 부분적 가림, 큰 초기 자세 오차에 대해 네트워크의 내구성은 어떠한가?
  • RQ4힘 감지 장치 없이도 시각 피드백만으로도 고정도의 로봇 삽입 작업을 수행할 수 있는가?
  • RQ5훈련 데이터의 분포를 훨씬 초월하는 자세 차이에 대해 반복적으로 적용해도 네트워크 성능이 유지되는가?

주요 결과

  • 네트워크는 이동 오차 10 mm, 회전 오차 5°의 초기 오차를 단일 추론에서 각각 0.6 mm 이하, 0.4° 이하로 감소시킨다.
  • 반복적으로 적용할 경우, 수 센티미터 이격과 수십 도의 자세 오차가 있는 초기 자세에서부터도 네트워크는 하위 밀리미터 정확도로 목표 자세로 로봇을 안내하는 데 성공한다.
  • 실제 환경에서의 VGA 커넥터 삽입 작업에서 힘 감지 장치 없이도 97.5%의 성공률을 기록한다.
  • 훈련 세트에 포함되지 않은 새로운 커넥터(A2)에 대해서도 일반화가 가능하여 시험 전반에서 96%의 성공률을 달성한다.
  • 조명 조건 변화, 부분적 가림, 이미지 노이즈에 대해 뛰어난 내구성을 보이며, 30%의 커넥터 가시성 조건에서도 반복 삽입 시험을 통해 이를 입증했다.
  • 작은 자세 차이에 대해서만 훈련된 네트워크도, 극단적인 초기 오차와 가림 조건이 있는 테스트 케이스 모두에서 정상적인 자세로 수렴하는 것을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.