Skip to main content
QUICK REVIEW

[논문 리뷰] Segmentation is All You Need

Zehua Cheng, Yuxiang Wu|arXiv (Cornell University)|2019. 04. 30.
Advanced Neural Network Applications참고 문헌 24인용 수 15
한 줄 요약

이 논문은 강력한 검출을 위한 세분화 모델을 활용하는 최초의 앵커-프리 및 NMS-프리 객체 검출 프레임워크인 WSMA-Seg를 제안한다. 약한 감독을 받는 바운딩 박스에서 유래한 다중모달 애너테이션과 런-데이터 기반 윤곽 추적 알고리즘을 사용하여, WSMA-Seg는 MS COCO, WIDER Face, Rebar Head 데이터셋에서 최신 기준 성능을 달성하며, 특히 가림, 소형 객체 검출과 같은 극한 조건에서 기존 검출기보다 정확도와 강건성 면에서 뛰어나다.

ABSTRACT

Region proposal mechanisms are essential for existing deep learning approaches to object detection in images. Although they can generally achieve a good detection performance under normal circumstances, their recall in a scene with extreme cases is unacceptably low. This is mainly because bounding box annotations contain much environment noise information, and non-maximum suppression (NMS) is required to select target boxes. Therefore, in this paper, we propose the first anchor-free and NMS-free object detection model called weakly supervised multimodal annotation segmentation (WSMA-Seg), which utilizes segmentation models to achieve an accurate and robust object detection without NMS. In WSMA-Seg, multimodal annotations are proposed to achieve an instance-aware segmentation using weakly supervised bounding boxes; we also develop a run-data-based following algorithm to trace contours of objects. In addition, we propose a multi-scale pooling segmentation (MSP-Seg) as the underlying segmentation model of WSMA-Seg to achieve a more accurate segmentation and to enhance the detection accuracy of WSMA-Seg. Experimental results on multiple datasets show that the proposed WSMA-Seg approach outperforms the state-of-the-art detectors.

연구 동기 및 목표

  • 가림, 낮은 조명, 소형 객체와 같은 극한 검출 시나리오에서 영역 제안 네트워크의 한계를 해결하기 위해.
  • 확장 가능한 검출 프레임워크의 성능 저하 요인인 비최대 억제(NMS) 및 앵커 박스 하이퍼파라미터의 필요성을 제거하기 위해.
  • 바운딩 박스 애너테이션 대신 픽셀 수준의 세분화 애너테이션을 활용하여 검출의 강건성과 정확도를 향상시키기 위해.
  • 다중 스케일 및 소형 객체 검출 성능 향상을 위한 새로운 세분화 백본인 MSP-Seg를 개발하기 위해.
  • 다중모달 애너테이션 설계를 통해 약한 감독을 받는 바운딩 박스 애너테이션만으로도 인스턴스 인식 세분화를 구현하기 위해.

제안 방법

  • 약한 감독을 받는 바운딩 박스 애너테이션을 세 가지 채널의 다중모달 애너테이션으로 변환하여 내부, 경계, 경계-내부 영역를 표현함으로써 세분화 감독을 위해 사용한다.
  • 다중모달 애너테이션을 사용하여 다중모달 히트맵을 학습시키는 세분화 모델을 훈련시켜 인스턴스 인식 객체 구조를 인코딩한다.
  • 학습된 세분화 맵에서 객체 윤곽을 추적하기 위해 런-데이터 기반의 추적 알고리즘을 적용하여 정밀한 윤곽 검출을 가능하게 한다.
  • 추적된 윤곽의 외접 사다리꼴을 최종 객체 검출 박스로 생성함으로써 NMS가 필요 없도록 한다.
  • 특히 소형 및 복잡한 객체에 대해 정확도를 향상시키기 위해 다중 스케일 풀링 세분화(MSP-Seg) 모델을 백본으로 통합한다.
  • 추론 중에 히트맵을 인스턴스 인식 세분화 맵으로 변환하기 위해 픽셀 수준의 논리 연산을 사용한다.

실험 결과

연구 질문

  • RQ1앵커 박스나 NMS에 의존하지 않고도 높은 성능을 달성할 수 있는 객체 검출 프레임워크가 존재할 수 있는가?
  • RQ2약한 감독을 받는 바운딩 박스에서 유도된 다중모달 애너테이션은 정확하고 인스턴스 인식 세분화를 가능하게 할 수 있는가?
  • RQ3NMS 없이도 세분화 맵에서 객체 경계를 효과적으로 복원할 수 있는 런-데이터 기반 윤곽 추적 알고리즘이 존재하는가?
  • RQ4다중 스케일 풀링 메커니즘이 소형 및 가림된 객체에 대한 세분화 및 검출 성능을 향상시키는가?
  • RQ5NMS-프리, 앵커-프리 검출 프레임워크가 극한 검출 시나리오에서 최신 기준 검출기보다 뛰어난 성능을 낼 수 있는가?

주요 결과

  • WSMA-Seg는 MS COCO test-dev에서 평균 정밀도(AP) 38.1을 달성하여, Faster R-CNN with TDM 및 CornerNet511를 포함한 모든 최신 기준 베이스라인을 초월한다.
  • MS COCO 데이터셋에서 WSMA-Seg는 소형 객체(AP^s)에 대해 22.5의 AP를 기록하여 이 어려운 범주에서 최고의 베이스라인(17.0)을 크게 앞서나간다.
  • WIDER Face 데이터셋에서 WSMA-Seg는 어려움(Easy)에 대해 94.70, 중간(Medium)에 대해 93.41, 어려움(Hard)에 대해 87.23의 F1 스코어를 기록하여 비교된 모든 최신 기준 방법을 초월한다.
  • MS COCO에서 WSMA-Seg는 평균 재현율(AR^1) 35.2를 기록하여 다음으로 우수한 방법(33.9)보다 뚜렷한 격차로 앞서나간다.
  • MSP-Seg 백본은 소형 객체 및 복잡한 시나리오에서 검출 정확도를 크게 향상시켜 AP^s 및 AR^s 지표의 향상으로 증명된다.
  • WSMA-Seg의 NMS-프리 설계는 IoU 임계값에 대한 하이퍼파라미터 튜닝이 필요 없게 하여 극한 상황에서의 확장성과 강건성을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.