Skip to main content
QUICK REVIEW

[논문 리뷰] Fully Convolutional One-Shot Object Segmentation for Industrial Robotics

Benjamin Schnieders, Shan Luo|arXiv (Cornell University)|2019. 03. 02.
Advanced Neural Network Applications인용 수 7
한 줄 요약

이 논문은 산업용 로봇을 위한 일회성 인스턴스 세그멘테이션을 위한 완전 컨볼루션 시아모이즈 네트워크를 제안한다. 이는 단일 프로토타입 이미지로부터 새로운 물체의 빠른 검출 및 세그멘테이션을 가능하게 한다. 다중 작업 학습을 통해 훈련된 모델은 7,000번의 반복 후에 미리 보지 않은 물체들에 대해 평균 73%의 정확도를 달성하며, 최소 4,000회의 반복(57분) 내에 수렴한다. 재훈련 후 실시간 로봇 취급이 가능해지며, 성공률은 약 97.77%로 추정된다.

ABSTRACT

The ability to identify and localize new objects robustly and effectively is vital for robotic grasping and manipulation in warehouses or smart factories. Deep convolutional neural networks (DCNNs) have achieved the state-of-the-art performance on established image datasets for object detection and segmentation. However, applying DCNNs in dynamic industrial scenarios, e.g., warehouses and autonomous production, remains a challenging problem. DCNNs quickly become ineffective when tasked with detecting objects that they have not been trained on. Given that re-training using the latest data is time consuming, DCNNs cannot meet the requirement of the Factory of the Future (FoF) regarding rapid development and production cycles. To address this problem, we propose a novel one-shot object segmentation framework, using a fully convolutional Siamese network architecture, to detect previously unknown objects based on a single prototype image. We turn to multi-task learning to reduce training time and improve classification accuracy. Furthermore, we introduce a novel approach to automatically cluster the learnt feature space representation in a weakly supervised manner. We test the proposed framework on the RoboCup@Work dataset, simulating requirements for the FoF. Results show that the trained network on average identifies 73% of previously unseen objects correctly from a single example image. Correctly identified objects are estimated to have a 87.53% successful pick-up rate. Finally, multi-task learning lowers the convergence time by up to 33%, and increases accuracy by 2.99%.

연구 동기 및 목표

  • 스마트 팩토리와 같은 동적인 산업 환경에서 로봇의 빠른 물체 검출 및 세그멘테이션을 가능하게 하기 위해.
  • 딥 러닝에서 장기적인 훈련 시간이 문제되는 점을 해결하기 위해, 새로운 물체에 대해 일회성 일반화를 가능하게 하기 위해.
  • 약한 감독 하에 특징 클러스터링 프레임워크에서 다중 작업 학습을 통해 훈련 시간을 단축하고 정확도를 향상시키기 위해.
  • 로보컵@워크 데이터셋을 사용한 미래 팩토리 시뮬레이션을 통해 방법을 검증하기 위해.
  • 일회성 세그멘테이션을 완전 훈련된 세그멘테이션으로 효과적으로 전환할 수 있음을 보여주기 위해.

제안 방법

  • 쿼리 이미지와 단일 프로토타입 이미지를 비교하기 위해 완전 컨볼루션 시아모이즈 네트워크 아키텍처를 사용하여 픽셀 단위의 세그멘테이션을 수행한다.
  • 교차 최적화를 통해 교차 합집합(IoU), 분류 정확도, 그리고 새로운 벡터 산란 지표를 함께 최적화함으로써 수렴성과 강건성을 향상시키기 위해 다중 작업 학습을 적용한다.
  • 수동 애너테이션을 요구하지 않고도 학습된 특징 표현을 자동으로 정렬하기 위해 약한 감독 하의 클러스터링 방법을 도입한다.
  • 로보컵@워크 데이터셋에서 엔드 투 엔드로 훈련되며, 이는 실제 산업 환경의 물체 변형과 배경을 시뮬레이션한다.
  • 새로운 물체의 단일 예제 이미지만으로도 빠른 재훈련이 가능하여, 네트워크가 완전히 수렴하기 전에도 배포가 가능하다.
  • 훈련 반복 횟수에 따라 성능을 추적하며, 미리 보지 않은 물체 클래스에 대해 IoU와 분류 정확도를 사용하여 모델을 평가한다.

실험 결과

연구 질문

  • RQ1DCNN가 단일 예제 기반으로 이전에 보지 않은 산업용 물체의 세그멘테이션 능력을 얼마나 잘 일반화할 수 있는가?
  • RQ2다중 작업 학습이 산업용 로봇의 일회성 세그멘테이션에서 수렴 속도와 분류 정확도에 어떤 영향을 미치는가?
  • RQ3약한 감독 하의 특징 클러스터링이 추가 애너테이션 없이도 일반화를 향상시킬 수 있는가?
  • RQ4재훈련 후 일회성 세그멘테이션의 성능은 완전 훈련된 세그멘테이션과 비교해 어떻게 되는가?
  • RQ5실제 로봇 조작 작업에서 신뢰할 수 있고 배포 가능한 성능에 도달하기 위해 필요한 최소 훈련 시간은 얼마인가?

주요 결과

  • 제안된 프레임워크는 로보컵@워크 데이터셋에서 7,000회의 훈련 반복 후에 평균 73개의 이전에 보지 않은 물체를 정확하게 세그멘테이션한다.
  • 다중 작업 학습을 통해 모델는 최소 4,000회의 반복(지니어스 1080 Ti에서 약 57분) 내에 수렴하며, 단일 작업 학습 대비 최대 33%의 수렴 시간 단축을 기록한다.
  • 다중 작업 학습은 단일 작업 기반 베이스라인 대비 분류 정확도를 2.99% 향상시킨다.
  • 모든 데이터에 대해 완전한 재훈련을 마친 후, 모델은 94%의 분류 정확도를 달성하며, 정확하게 식별된 물체에 대해 약 97.77%의 성공적인 취급률을 추정한다.
  • IoU, 정확도, 벡터 산란, 세그멘테이션의 네 가지 작업 모두에 대해 훈련할 경우, 덜 많은 작업에 대해 훈련하는 것보다 더 빠른 수렴과 낮은 오차를 기록한다.
  • 다양한 산업용 물체로 구성된 다양성 있는 스팬닝 세트로 훈련할 경우, 네트워크는 새로운 물체 클래스에 대해 강건한 일반화 능력을 보이며 특정 훈련 세부 사항에 대한 과적합을 최소화한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.