Skip to main content
QUICK REVIEW

[논문 리뷰] Single Pixel Reconstruction for One-stage Instance Segmentation

Jun Yu, Jinghan Yao|arXiv (Cornell University)|2019. 04. 16.
Advanced Neural Network Applications참고 문헌 32인용 수 10
한 줄 요약

이 논문은 단일 특징 맵 픽셀에서 직접 인스턴스 마스크를 재구성하는 전용 Single Pixel Reconstruction (SPR) 브랜치를 사용하여 한 단계 식별 분할 프레임워크인 SPRNet을 제안한다. 이는 Mask R-CNN와 같은 이단계 방법보다 빠른 추론 속도를 기록하면서도 최신 기준 성능을 달성한다. 개선된 Gate-FPN (GFPN)을 통합함으로써 SPRNet은 COCO 벤치마크에서 RetinaNet과 Mask R-CNN를 모두 능가하며, 특히 소형 객체 탐지 및 속도 측면에서 뛰어난 성능을 보인다.

ABSTRACT

Object instance segmentation is one of the most fundamental but challenging tasks in computer vision, and it requires the pixel-level image understanding. Most existing approaches address this problem by adding a mask prediction branch to a two-stage object detector with the Region Proposal Network (RPN). Although producing good segmentation results, the efficiency of these two-stage approaches is far from satisfactory, restricting their applicability in practice. In this paper, we propose a one-stage framework, SPRNet, which performs efficient instance segmentation by introducing a single pixel reconstruction (SPR) branch to off-the-shelf one-stage detectors. The added SPR branch reconstructs the pixel-level mask from every single pixel in the convolution feature map directly. Using the same ResNet-50 backbone, SPRNet achieves comparable mask AP to Mask R-CNN at a higher inference speed, and gains all-round improvements on box AP at every scale comparing with RetinaNet.

연구 동기 및 목표

  • 영역 제안 (RPN) 이론이 필요 없는 한 단계 인스턴스 분할 프레임워크를 개발함으로써 고효율성을 달성하는 것.
  • RoI 없이 단일 특징 맵에서 다수의 인스턴스를 구분하고 분할하는 문제를 해결하는 것.
  • 특징 수준 간 기울기 간섭을 줄임으로써 다중 척도 탐지에서 특징 융합을 향상시키는 것.
  • 이단계 탐지기보다 훨씬 빠른 추론 속도를 기록하면서도 경쟁 가능한 인스턴스 분할 정확도를 달성하는 것.
  • 한 단계 프레임워크에서 소형 객체 탐지에 뛰어난 성능을 발휘할 수 있도록 하는 것.

제안 방법

  • 단일 특징 맵 픽셀에서 디컨볼루션을 사용하여 32×32 마스크 점수 맵을 생성하는 Single Pixel Reconstruction (SPR) 브랜치를 도입한다.
  • 마스크 재구성 이전에 선택된 픽셀 주변의 확장 컨볼루션을 사용하여 충분한 문맥 정보를 확보한다.
  • 정확한 단일 픽셀 기반 마스크 예측을 지원하기 위해 향상된 특징 표현을 갖춘 수정된 백본을 사용한다.
  • 특징 수준 간 기울기 누출을 억제하기 위해 특징 융합 이전에 게이팅 메커니즘을 도입한 Gate-FPN (GFPN)을 제안한다.
  • 가중치 학습이 가능한 게이팅을 사용한 요소별 덧셈을 통해 서로 다른 FPN 수준의 특징을 선택적으로 융합함으로써 특징 품질 향상과 탐지 신뢰도 향상을 도모한다.
  • SPR 브랜치가 분류 및 회귀 헤드와 병렬로 작동하는 인코더-디코더 아키텍처를 채택한다.

실험 결과

연구 질문

  • RQ1이단계 모델인 Mask R-CNN와 비교해 성능이 유사하면서도 훨씬 더 빠른 한 단계 인스턴스 분할 모델을 구현할 수 있는가?
  • RQ2영역 제안에 의존하지 않고 단일 특징 맵 픽셀에서 마스크 예측을 효과적으로 시작할 수 있는가?
  • RQ3특징 수준 간 기울기 흐름을 제어함으로써 특징 융합에서 게이팅 메커니즘이 소형 및 대형 객체 탐지 정확도 향상에 기여하는가?
  • RQ4제안된 SPRNet 프레임워크가 모든 객체 척도에서 기존의 한 단계 탐지기인 RetinaNet를 뛰어넘는 성능을 달성하는가?
  • RQ5ResNet-50 백본만을 사용하여 SPRNet 프레임워크가 COCO 인스턴스 분할 벤치마크에서 최신 기준 성능을 달성할 수 있는가?

주요 결과

  • ResNet-50를 사용한 SPRNet는 COCO 검증 세트에서 마스크 AP 36.6을 기록하였으며, 이는 ResNet-101과 RoIAlign를 사용한 Mask R-CNN와 유사한 성능이지만 더 빠른 추론 속도를 기록한다.
  • ResNet-50와 GFPN를 사용한 SPRNet는 소형 객체에 대해 20.2%의 AP_S를 달성하여, ResNet-101를 사용한 최고의 이단계 방법을 뛰어넘었다.
  • GFPN를 적용한 RetinaNet는 AP_S를 2.4 포인트 향상시켜(32.0에서 34.4로), 소형 객체 탐지에서 뚜렷한 성과 향상을 보였다.
  • ResNet-101과 GFPN를 사용한 SPRNet는 AP_S 29.7%와 AR_L 68.0%를 기록하여, ResNet-101-FPN를 사용한 Mask R-CNN를 모두 뛰어넘었다.
  • GFPN 모듈은 특징 수준 간 기울기 간섭을 감소시켜 모든 척도에서 탐지 성능 향상에 기여하였으며, 특히 대형 객체에서 두드러진 효과를 보였다.
  • SPRNet 프레임워크는 한 단계 인스턴스 분할에서 최신 기준 성능을 달성하였으며, 높은 정확도와 빠른 속도가 한 단계 설계에서 동시에 달성될 수 있음을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.