Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Occlusion-Aware Instance Segmentation with Overlapping BiLayers

Lei Ke, Yu‐Wing Tai|arXiv (Cornell University)|2021. 03. 23.
Advanced Neural Network Applications참고 문헌 63인용 수 8
한 줄 요약

이 논문은 겹치는 물체를 두 개의 별도 층으로 분해함으로써 음영을 명시적으로 모델링하는 새로운 이중단계 인스턴스 세그멘테이션 프레임워크인 Bilayer Convolutional Network(BCNet)을 제안한다: 상층부의 음영 물체(occluder)와 하층부의 음영을 입은 물체(occludee)로 나누어 모델링한다. BCNet은 두 개의 그래프 컨볼루션 네트워크(GCNs)를 계단식으로 연결하여 두 물체의 마스크와 윤곽을 동시에 회귀시키며, 음영 윤곽을 진짜 물체 윤곽에서 분리시킴으로써 COCO와 KINS에서 최신 기술 수준의 성능을 달성한다. 특히 심한 음영 상황에서 뛰어난 성능을 보인다.

ABSTRACT

Segmenting highly-overlapping objects is challenging, because typically no distinction is made between real object contours and occlusion boundaries. Unlike previous two-stage instance segmentation methods, we model image formation as composition of two overlapping layers, and propose Bilayer Convolutional Network (BCNet), where the top GCN layer detects the occluding objects (occluder) and the bottom GCN layer infers partially occluded instance (occludee). The explicit modeling of occlusion relationship with bilayer structure naturally decouples the boundaries of both the occluding and occluded instances, and considers the interaction between them during mask regression. We validate the efficacy of bilayer decoupling on both one-stage and two-stage object detectors with different backbones and network layer choices. Despite its simplicity, extensive experiments on COCO and KINS show that our occlusion-aware BCNet achieves large and consistent performance gain especially for heavy occlusion cases. Code is available at https://github.com/lkeab/BCNet.

연구 동기 및 목표

  • 기존 방법이 음영 윤곽을 진짜 물체 윤곽과 혼동하는 바람에, 매우 겹쳐진 물체 상황에서의 인스턴스 세그멘테이션 문제를 해결한다.
  • Mask R-CNN와 같은 기존 이중단계 인스턴스 세그멘테이션 프레임워크의 한계를 극복한다. 이는 음영 영역을 대상 물체의 일부로 간주하고, 음영 물체와 음영을 입은 물체 간의 상호작용을 모델링하지 못한다는 점이다.
  • 각 ROI 내에서 음영 관계를 명시적으로 모델링함으로써, 일반적인(보이는) 및 아모달(완전한) 인스턴스 세그멘테이션 성능을 향상시킨다.
  • 각각의 GCN 층을 통해 음영 물체와 음영을 입은 물체 예측을 분리함으로써, 더 설명 가능하고 명확한 세그멘테이션 출력을 제공한다.
  • 향후 음영 처리 연구를 지원하기 위해, 음영 물체와 음영을 입은 물체의 진짜 윤곽을 포함한, 새로운 대규모 음영 인식 데이터셋을 기여한다.

제안 방법

  • 동일한 ROI 내에서 상층 GCN 층이 음영 물체(occluder)를 검출하고, 하층 GCN 층이 부분적으로 음영을 입은 인스턴스(occludee)를 회귀시키는 이중층 구조를 제안한다.
  • 두 층 모두 그래프 컨볼루션 네트워크(GCNs)를 사용하여 장거리 및 국소적이지 않은 픽셀 간 관계를 모델링함으로써, 음영 영역을 넘어선 정보 전파를 가능하게 한다.
  • 두 층이 함께 마스크와 윤곽을 회귀시키는 계단식 GCN 아키텍처를 구현하며, 음영 물체와 음영을 입은 물체 간의 상호작용을 명시적으로 모델링한다.
  • 음영 물체와 음영을 입은 영역을 별도의 층으로 간주함으로써, 음영 윤곽과 진짜 물체 윤곽을 분리시켜, 윤곽 혼동을 줄인다.
  • BCNet 헤드를 다양한 객체 검출기(Faster R-CNN, FCOS)와 백본(ResNet-50, ResNet-101)과 통합하여, 다양한 아키텍처 간의 일반화 능력을 입증한다.
  • COCO에서 유래한 새로운 음영 인식 데이터셋을 사용하여 훈련하며, 심한 음영에 대한 강건성을 향상시키기 위해 합성 음영 증강 기법을 도입한다.

실험 결과

연구 질문

  • RQ1겹치는 물체 간의 음영 관계를 명시적으로 모델링하면, 특히 심한 음영 상황에서 인스턴스 세그멘테이션 성능이 향상되는가?
  • RQ2음영 물체와 음영을 입은 물체 예측을 별도의 층으로 분리하면, 단일층 마스크 헤드에 비해 더 정확하고 설명 가능한 마스크 예측이 가능한가?
  • RQ3BCNet은 전용 아모달 세그멘테이션 방법에 비해 아모달 인스턴스 세그멘테이션(완전한 물체 형태 예측)에서 어떤 성능을 보이는가?
  • RQ4제안된 이중층 GCN 아키텍처는 다양한 객체 검출기와 백본 네트워크에 대해 얼마나 일반화되는가?
  • RQ5합성 음영 데이터 증강 기법이 실제 음영 상황의 인스턴스에 대한 일반화 능력을 크게 향상시키는가?

주요 결과

  • Faster R-CNN에 ResNet-101을 사용한 BCNet은 COCO에서 39.8 AP를 달성하여, 동일한 설정에서 Mask Scoring R-CNN(38.3 AP)과 HTC(39.7 AP)를 모두 능가한다.
  • 심한 음영 상황을 위한 COCO-OCC 분할에서, 합성 음영 데이터로 미세조정한 후 BCNet은 32.89 AP를 기록하여, Mask Scoring R-CNN의 30.32 AP를 초월한다.
  • COCOA에서의 아모달 세그멘테이션에서, BCNet은 AmodalMask와 ORCNN에 비해 더 자연스럽고 정확한 형태 유추를 제공하며, 정량적 비교에서 더 적은 세그멘테이션 오류를 보였다.
  • KINS에서 BCNet은 Mask R-CNN + ASN보다 복잡한 음영 상황에서 인접한 차량의 경계 예측이 더 정확했다.
  • 이중층 GCN 설계 덕분에 더 설명 가능한 예측이 가능해졌으며, 시각화 결과는 GCN-1이 음영 물체를 검출하고 GCN-2가 음영을 입은 물체를 회귀시키며, 각각의 히트맵 패턴이 뚜렷하게 구분됨을 보여준다.
  • BCNet은 ResNet-50, ResNet-101 등 다양한 백본과 Faster R-CNN, FCOS 등 다양한 검출기에서 일관되게 성능 향상을 보이며, 강력한 일반화 능력을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.