Skip to main content
QUICK REVIEW

[논문 리뷰] Mask Encoding for Single Shot Instance Segmentation

Rufeng Zhang, Zhi Tian|arXiv (Cornell University)|2020. 03. 26.
Advanced Neural Network Applications참고 문헌 35인용 수 4
한 줄 요약

이 논문은 FCOS와 같은 one-stage 검출기 내에서 회귀 기반 마스크 예측을 효율적으로 구현하기 위해 사전 학습 기반 기법(예: PCA)을 사용해 2D 인스턴스 마스크를 고정된 차원의 밀도 높은 벡터로 인코딩하는 새로운 single-shot instance segmentation 프레임워크인 MEInst를 제안한다. 단일 ResNeXt-101-FPN 모델과 단일 스케일 테스트 조건에서 COCO 데이터셋에서 36.9%의 마스크 AP를 달성하며, 이는 기존 one-stage 방법들을 능가하고 소형 객체에 대해서도 뛰어난 성능을 보이며 실시간 추론 능력을 유지한다.

ABSTRACT

To date, instance segmentation is dominated by twostage methods, as pioneered by Mask R-CNN. In contrast, one-stage alternatives cannot compete with Mask R-CNN in mask AP, mainly due to the difficulty of compactly representing masks, making the design of one-stage methods very challenging. In this work, we propose a simple singleshot instance segmentation framework, termed mask encoding based instance segmentation (MEInst). Instead of predicting the two-dimensional mask directly, MEInst distills it into a compact and fixed-dimensional representation vector, which allows the instance segmentation task to be incorporated into one-stage bounding-box detectors and results in a simple yet efficient instance segmentation framework. The proposed one-stage MEInst achieves 36.4% in mask AP with single-model (ResNeXt-101-FPN backbone) and single-scale testing on the MS-COCO benchmark. We show that the much simpler and flexible one-stage instance segmentation method, can also achieve competitive performance. This framework can be easily adapted for other instance-level recognition tasks. Code is available at: https://git.io/AdelaiDet

연구 동기 및 목표

  • Mask R-CNN와 같은 two-stage 방법에 비해 성능이 열등한 one-stage instance segmentation에서 인스턴스 마스크를 효율적으로 압축 표현하는 문제를 해결하기 위해.
  • 2D 마스크를 고정된 차원의 표현 벡터로 압축함으로써 설계 및 계산 복잡도를 감소시키고, 효율적이고 정확한 마스크 예측을 가능하게 하기 위해.
  • 복잡한 아키텍처나 다단계 파ipeline에 의존하지 않고도 단순한 one-stage 프레임워크와 마스크 계수 회귀 기반으로 경쟁력 있는 정확도를 달성할 수 있음을 보여주기 위해.
  • 사전 학습 기반 기법(예: PCA)을 통한 마스크 인코딩이 노이즈에 강건하고 재구성가능성이 높은 마스크 표현을 가능하게 함을 보여주기 위해.
  • anchor-based 및 anchor-free 모두에 적용 가능한 일반화 가능한 프레임워크를 구축하기 위해.

제안 방법

  • PCA, 스퍼스 코딩, 또는 오토에인코더와 같은 사전 학습 기반 기법을 사용해 각 2D 인스턴스 마스크를 압축된 고정 차원의 벡터로 인코딩한다.
  • 자연스러운 마스크의 낮은 내재 차원성을 활용하여 데이터셋의 인스턴스 마스크에서 표현을 학습함으로써 중복을 감소시킨다.
  • FCOS와 같은 one-stage 검출기에 병렬 마스크 브랜치를 추가하여 고정된 차원의 마스크 계수를 회귀함으로써 엔드 투 엔드 학습을 가능하게 한다.
  • 학습된 사전를 사용해 계수 벡터를 디코딩함으로써 재구성된 마스크를 확보함으로써 고정밀도 마스크 재구성 가능하다.
  • anchor-based 및 anchor-free 검출기 모두와 호환되며, 아키텍처 수정이 최소한으로 필요하다.
  • 특히 분리된 형태나 복잡한 형태에서 발생하는 '빈약한 부패' 아티팩트를 야기하는 윤곽 기반 표현 방식을 피한다.

실험 결과

연구 질문

  • RQ1인스턴스 마스크의 압축된 고정 차원의 벡터 표현이 one-stage 검출기에서 경쟁 가능한 분할 정확도를 달성할 수 있는가?
  • RQ2사전 학습 기반 기법(예: PCA)을 통한 마스크 인코딩이 매개변수 기반 윤곽 기반 방법에 비해 더 높은 재구성 정밀도와 강건성을 제공하는가?
  • RQ3마스크 계수 회귀 기반의 단순한 one-stage instance segmentation 프레임워크가 기존 one-stage 방법들보다 정확도와 추론 속도 면에서 뛰어난 성능을 내는가?
  • RQ4Mask R-CNN와 같은 two-stage 방법과 비교했을 때, 본 방법은 소형 및 대형 객체에서 어떻게 성능을 내는가?
  • RQ5이 마스크 인코딩 프레임워크는 다양한 one-stage 검출기 아키텍처에 얼마나 일반화될 수 있는가?

주요 결과

  • MEInst는 단일 ResNeXt-101-FPN 모델과 단일 스케일 테스트 조건에서 COCO에서 36.9%의 마스크 AP를 달성하며, 대부분의 기존 one-stage 방법들을 능가한다.
  • ESE-Seg와 같은 최신 윤곽 기반 방법보다 AP50에서 11.8% 향상되고 AP75에서 16.5% 향상되어 더 높은 정확도와 세부 사항 보존 능력을 입증한다.
  • 재구성 오차가 낮고 더 효과적인 마스크 표현을 통해, 유사한 계산 복잡도에서도 PolarMask를 초월하는 정확도를 확보한다.
  • 소형 객체(면적 < 32²)에서는 38.0%의 마스크 AP를 기록하여 Mask R-CNN의 35.3%를 상회함으로써, 소형 인스턴스 처리에서 뚜렷한 이점이 있음을 보여준다.
  • 대형 객체에서는 46.7%의 마스크 AP를 기록하여 Mask R-CNN의 53.5%에 비해 성능 격차가 존재함을 시사하며, 이는 고밀도 마스크에 대해 압축된 벡터 표현의 표현 능력 한계 때문임을 시사한다.
  • 데이터 증강(다중 스케일)을 적용하면 MEInst는 COCO test-dev에서 38.2%의 마스크 AP를 달성하여 강력한 확장성과 향후 성능 향상 잠재력을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.