[논문 리뷰] Instance Segmentation of Visible and Occluded Regions for Finding and Picking Target from a Pile of Objects
이 논문은 객체 간 상호작용 관계를 모델링하는 새로운 'relook' 아키텍처를 통해 가시 영역과 가림 영역을 동시에 예측하는 인스턴스 음영 세분화 기반으로, 혼잡한 더러운 산성에서 목표 물체를 찾고 집는 로봇 시스템을 제안한다. 이 시스템은 인간 레이블이 필요한 데이터셋을 제거하기 위해 합성 데이터 생성 기반으로 설계되었으며, 음영 인식 세분화 분야에서 최신 기술 수준의 성능을 달성하여 복잡하고 음영이 많은 환경에서의 실제 로봇 집기 작업을 성공적으로 수행한다.
We present a robotic system for picking a target from a pile of objects that is capable of finding and grasping the target object by removing obstacles in the appropriate order. The fundamental idea is to segment instances with both visible and occluded masks, which we call `instance occlusion segmentation'. To achieve this, we extend an existing instance segmentation model with a novel `relook' architecture, in which the model explicitly learns the inter-instance relationship. Also, by using image synthesis, we make the system capable of handling new objects without human annotations. The experimental results show the effectiveness of the relook architecture when compared with a conventional model and of the image synthesis when compared to a human-annotated dataset. We also demonstrate the capability of our system to achieve picking a target in a cluttered environment with a real robot.
연구 동기 및 목표
- 비스킷에 겹쳐진 물체들이나 중첩된 물체들이 있는 환경에서 로봇이 목표 물체를 식별하고 집을 수 있도록 하는 것.
- 목표 물체가 장애물에 의해 가려져 있을 경우, 보이지 않는 영역을 추론함으로써 올바른 집기 순서를 계획하는 과제를 해결하는 것.
- 실제 레이블이 포함된 데이터셋에 의존하지 않도록, 실제 음영 패턴과 정답 마스크를 생성하는 데이터 합성 프레임워크를 통해 인간 레이블이 없는 데이터셋을 대체하는 것.
- 가시 영역과 음영 영역의 세분화 성능을 향상시키기 위해 인스턴스 간 상호관계를 명시적으로 모델링하는 딥 러닝 모델을 개발하는 것.
- 중요한 음영이 있는 환경에서 실제 로봇 집기 작업에 대한 시스템의 효과성을 입증하는 것.
제안 방법
- 객체 인스턴스 간 밀도와 공간적 관계를 모델링함으로써 인스턴스 세분화 성능을 향상시키기 위해 새로운 'relook' 아키텍처를 도입하여 음영 영역 예측을 개선한다.
- 이미지 합성 기법을 사용해 개별 객체 인스턴스 이미지에서 다양한 쌓기 구성(스택 구성)을 생성하고, 가시 영역과 음영 영역에 대한 정답 마스크가 포함된 합성 데이터셋을 생성한다.
- 모델은 합성 데이터에 대해 엔드 투 엔드로 훈련되어, 인간 레이블 없이도 새로운 객체에 대해 제로샷 일반화가 가능하다.
- 각 인스턴스에 대해 가시 영역과 음영 영역 마스크를 동시에 예측하기 위해 다중 클래스 세분화 헤드를 사용하며, 기존 인스턴스 세분화를 음영을 별도의 클래스로 다룰 수 있도록 확장한다.
- 장애물 여부를 판단하기 위해 음영 비율 임계값(0.3)과 인스턴스 간 음영 비율 임계값(0.1)을 사용한다.
- 특징 추출을 향상시키기 위해 ResNet101을 백본 네트워크로 사용하며, 공정한 비교를 위해 3개의 GPU를 활용해 학습률 스케일링을 적용한다.
실험 결과
연구 질문
- RQ1인간 레이블이 없는 훈련 데이터 없이도 시각 시스템이 혼잡한 환경에서 객체의 음영 영역을 예측할 수 있는가?
- RQ2인스턴스 간 상호관계를 모델링하는 'relook' 아키텍처는 기존 모델 대비 인스턴스 음영 세분화 성능을 얼마나 향상시키는가?
- RQ3합성 데이터 생성 기법이 음영 인식 세분화에서 인간 레이블이 포함된 데이터셋을 대체할 수 있는 충분한 일반화 능력을 제공하는가?
- RQ4제안된 시스템은 무거운 음영이 있는 실제 로봇 조작 작업에서 정확한 집기 순서 계획을 얼마나 잘 수행하는가?
- RQ5훈련 중에 보지 못한 새로운 객체를 포함한 실제 로봇 집기 작업에서 시스템의 성능은 어떠한가?
주요 결과
- 'relook' 아키텍처는 mPQ 14.4를 기록하여 기준 모델인 Softmax(13.4)와 Softmax_x2(13.8)를 뛰어넘는 성능을 보이며, 음영 세분화 성능 향상의 효과를 입증했다.
- relook 모델의 mAP 점수는 48.6로, Softmax(46.1) 및 Softmax_x2(47.1) 기준 모델을 모두 초월하여 검출 및 가시 마스크 품질 향상을 입증했다.
- 합성 데이터셋은 인간 레이블이 포함된 데이터셋의 mPQ 14.4와 매우 유사한 mPQ 14.2를 기록하여, 이미지 합성 프레임워크의 유효성을 입증했다.
- 시스템은 실제 산성에서 목표 물체를 성공적으로 집는 것을 입증했으며, 장애물 제거 순서도 정확하게 수행했다(예: 덤벨보다 테니스 볼 홀더를 먼저 제거).
- ResNet101을 백본으로 사용함으로써 인식 정확도가 향상되어, 복잡한 실제 혼잡 환경에서도 견고한 성능을 발휘했다.
- 0.3의 음영 비율 임계값을 사용한 결과, 중첩된 구성에서 가로막힌 목표 물체를 정확히 식별할 수 있는 신뢰할 수 있는 음영 추론 능력을 확보했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.