Skip to main content
QUICK REVIEW

[논문 리뷰] Geometry-Aware Instance Segmentation with Disparity Maps

Cho-Ying Wu, Xiaoyan Hu|arXiv (Cornell University)|2020. 06. 14.
Advanced Vision and Imaging참고 문헌 42인용 수 4
한 줄 요약

이 논문은 자율주행 주행 환경에서 3차원 인식에 적합한 객체 검출 및 세분화 성능을 향상시키기 위해 RGB 이미지와 스테레오 카메라에서 생성된 디스패리티 맵을 융합하는 기하학적 인식 인스턴스 세분화 프레임워크인 GAIS-Net을 제안한다. 허위 긍정을 억제하고 마스크 예측 성능을 향상시키기 위해 가짜 라이다 투영과 다중 모odal ROI 특징(2D, 2.5D, 3D)을 활용함으로써 기하학적 사전 지식을 통합한다. 이로 인해 도시스케이프보다 4배 더 큰 기준선과 초점 거리(3.3K px)를 가진 새로 수집한 고품질 주행 스테레오(HQDS) 데이터셋에서 최신 기술 수준(SOTA)의 성능을 달성한다.

ABSTRACT

Most previous works of outdoor instance segmentation for images only use color information. We explore a novel direction of sensor fusion to exploit stereo cameras. Geometric information from disparities helps separate overlapping objects of the same or different classes. Moreover, geometric information penalizes region proposals with unlikely 3D shapes thus suppressing false positive detections. Mask regression is based on 2D, 2.5D, and 3D ROI using the pseudo-lidar and image-based representations. These mask predictions are fused by a mask scoring process. However, public datasets only adopt stereo systems with shorter baseline and focal legnth, which limit measuring ranges of stereo cameras. We collect and utilize High-Quality Driving Stereo (HQDS) dataset, using much longer baseline and focal length with higher resolution. Our performance attains state of the art. Please refer to our project page. The full paper is available here.

연구 동기 및 목표

  • 스테레오 디스패리티 맵에서 유도한 기하학적 단서를 통합함으로써 외부 환경에서의 인스턴스 세분화의 강인성을 향상시키기 위해.
  • 조명, 그림자, 무늬 변화에 민감한 단일 카메라 또는 RGB 전용 방법의 한계를 해결하기 위해.
  • 2D, 2.5D, 3D 표현을 융합하는 다중 모달, 엔드 투 엔드 학습 가능한 네트워크를 개발하여 마스크 예측 성능을 향상시키기 위해.
  • 더 나은 원거리 스테레오 매칭과 기하학적 추론을 가능하게 하기 위해 더 긴 기준선과 초점 거리를 가진 고품질 스테레오 데이터셋(HQDS)을 수집하고 공개하기 위해.
  • 디스패리티 맵에서 유도한 기하학적 사전 지식이 허위 긍정을 감소시키고, 특히 겹치거나 먼 거리에 있는 객체의 마스크 품질을 향상시키는지 검증하기 위해.

제안 방법

  • 스테레오 이미지 쌍에서 PSMNet을 사용해 고밀도 디스패리티 맵을 생성하고, 이를 가짜 라이다 역투영을 통해 3차원 공간으로 변환한다.
  • ResNet50-FPN 기반과 RPN을 사용해 왼쪽 이미지에서 영역 제안을 추출하여 2D ROIs를 형성한다.
  • 2.5D ROIs는 디스패리티 맵에서 잘라내고, 3D ROIs는 디스패리티 값들을 3차원 포인트 클라우드로 역투영하여 생성한다.
  • PointNet 기반 네트워크가 3D ROIs를 처리하여 3차원 특징을 추출하고, 각 점의 마스크 확률을 예측한다. 이는 손실 계산을 위해 2D로 재투영된다.
  • 2D, 2.5D, 3D 마스크 예측 결과는 마스크 점수 기반 융합 메커니즘을 통해 통합되어 최종 마스크 신뢰도와 IoU를 향상시킨다.
  • 합성 손실 함수를 사용해 네트워크를 학습한다: $π_{box}$, $π_{cls}$, $π_{2Dmask}$, $π_{3Dmask}$, 그리고 마스크 품질을 개선하기 위한 MaskIoU 헤드.

실험 결과

연구 질문

  • RQ1스테레오 카메라에서 생성된 디스패리티 맵이 형태와 깊이에 대한 기하학적 사전 지식을 제공함으로써 인스턴스 세분화 성능을 향상시킬 수 있는가?
  • RQ22D, 2.5D, 3D 표현을 융합함으로써 마스크 예측 정확도는 어떻게 향상되고, 허위 긍정은 어떻게 감소하는가?
  • RQ3스테레오 시스템에서 더 긴 기준선과 초점 거리는 원거리 객체 검출 및 기하학적 일관성 향상에 얼마나 기여하는가?
  • RQ4이미지, 디스패리티, 3차원 포인트 클라우드 특징을 융합하는 다중 모달 네트워크가 순수한 RGB 기반 인스턴스 세분화 모델보다 우월한 성능을 내는가?
  • RQ5제안된 마스크 점수 융합 메커니즘이 개별 모달리티 예측에 비해 최종 세분화 품질을 어떻게 향상시키는가?

주요 결과

  • GAIS-Net은 동일한 백본을 사용한 Mask-RCNN 대비 40.7%의 마스크 AP를 기록하며 HQDS 데이터셋에서 최신 기술 수준 성능을 달성했다.
  • HQDS 테스트 세트에서 GAIS-Net은 박스 AP를 9.7%p 향상시켜 36.3%에서 46.0%로 향상시키고, 마스크 AP는 33.9%에서 40.7%로 6.8%p 향상시켰다.
  • Cityscapes에서 GAIS-Net은 COCO에서 미리 학습한 후 37.1%의 마스크 AP를 기록했으며, 동일한 설정에서 Mask-RCNN의 36.4%를 초월했다.
  • HQDS와 Cityscapes 간 성능 격차의 주요 원인은 HQDS가 더 긴 기준선(0.5 m)과 초점 거리(3.3K px)를 가졌기 때문이며, 이는 더 나은 원거리 스테레오 매칭과 기하학적 추정을 가능하게 한다.
  • 마스크 점수 융합 메커니즘이 2D, 2.5D, 3D 표현의 예측을 통합함으로써 더 일관되고 정확한 마스크를 생성하여 마스크 품질을 향상시켰다.
  • HQDS 데이터셋은 6,000개의 훈련 및 1,200개의 테스트 스테레오 쌍을 포함하며, 1024×3072 해상도에서 제공되며 도시스케이프보다 $f \times b$ 곱이 4배 더 크다. 이는 스테레오 기반 인스턴스 세분화의 더 신뢰할 수 있는 평가를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.