[논문 리뷰] CenterMask: single shot instance segmentation with point representation
CenterMask는 객체 중심점 표현을 사용하여 겹치는 인스턴스를 구분하는 局소 형태 예측과 정밀한 픽셀 수준 분할을 위한 글로벌 사활성 지도 생성이라는 두 가지 병렬 브랜치로 마스크 예측을 분리하는 단순하고 빠르며 정확한 one-stage 인스턴스 세분화 방법을 제안한다. 단일 스케일 추론으로 사전 학습 없이 훈련하여 COCO에서 12.3 fps에서 34.5 mask AP를 달성하며, TensorMask를 제외한 모든 one-stage 방법보다 뛰어난 성능을 보인다.
In this paper, we propose a single-shot instance segmentation method, which is simple, fast and accurate. There are two main challenges for one-stage instance segmentation: object instances differentiation and pixel-wise feature alignment. Accordingly, we decompose the instance segmentation into two parallel subtasks: Local Shape prediction that separates instances even in overlapping conditions, and Global Saliency generation that segments the whole image in a pixel-to-pixel manner. The outputs of the two branches are assembled to form the final instance masks. To realize that, the local shape information is adopted from the representation of object center points. Totally trained from scratch and without any bells and whistles, the proposed CenterMask achieves 34.5 mask AP with a speed of 12.3 fps, using a single-model with single-scale training/testing on the challenging COCO dataset. The accuracy is higher than all other one-stage instance segmentation methods except the 5 times slower TensorMask, which shows the effectiveness of CenterMask. Besides, our method can be easily embedded to other one-stage object detectors such as FCOS and performs well, showing the generalization of CenterMask.
연구 동기 및 목표
- 앵커 박스 없이 단순하고 빠르며 정확한 one-stage 인스턴스 세분화 방법을 개발하기 위해.
- 겹치는 객체 상황에서의 인스턴스 구분 및 픽셀 수준 특징의 비일치 문제를 해결하기 위해.
- 마스크 예측을 두 가지 상호보완적인 구성 요소로 분리하여 정확도와 속도를 향상시키기 위해: 인스턴스 인식 가능한 局소 형태와 인스턴스 무관한 글로벌 사활성 지도.
- FCOS와 같은 다른 one-stage 검출기로의 일반화를 가능하게 하여 광범위한 적용 가능성을 입증하기 위해.
제안 방법
- 모델은 객체 중심점 위치를 예측하기 위한 키포인트 추정 헤드를 사용하며, 이 중심점에서 특징을 추출하여 굵은 국소 형태 마스크를 생성한다.
- 완전 컨volution 블록은 픽셀 수준의 전경-배경 분류를 위한 글로벌 사활성 지도를 생성하여 정밀한 경계 정렬을 가능하게 한다.
- 최종 인스턴스 마스크는 굵은, 인스턴스 인식 가능한 국소 형태와 정밀한, 인스턴스 무관한 글로벌 사활성 지도의 원소별 곱셈으로 형성된다.
- 국소 형태 브랜치는 중심점에서의 형태 벡터 표현을 사용하여 겹치는 조건에서도 효과적인 인스턴스 분리가 가능하다.
- 글로벌 사활성 지도는 의미 세분화처럼 작동하여 정밀한 경계를 위한 고해상도이고 정렬된 특징을 제공한다.
- 모델은 사전 학습된 가중치 없이 엔드 투 엔드로 끝내기까지 훈련되며, 추론 과정에서 NMS 없이 수행된다.
실험 결과
연구 질문
- RQ1앵커 박스나 복잡한 후처리 없이 one-stage 인스턴스 세분화 모델이 높은 정확도를 달성할 수 있는가?
- RQ2간단하고 학습 가능한 표현을 통해 겹치는 상황에서 객체 인스턴스를 효과적으로 구분할 수 있는가?
- RQ3TensorMask와 같은 고비용의 시간 소모적 연산 없이도 픽셀 수준의 특징 정렬을 달성할 수 있는가?
- RQ4국소 형태와 글로벌 사활성 지도의 조합이 인스턴스 분리 및 마스크 정밀도 향상에 얼마나 기여하는가?
- RQ5제안된 구성 요소들이 FCOS와 같은 다른 one-stage 검출기로 일반화될 수 있는가?
주요 결과
- CenterMask는 단일 스케일 훈련 및 테스트로 COCO에서 12.3 fps에서 34.5 mask AP를 달성하며, TensorMask를 제외한 모든 one-stage 인스턴스 세분화 방법보다 뛰어난 성능을 보였다.
- 국소 형태 브랜치만으로도 겹치는 상황에서 효과적인 인스턴스 분리가 가능하여 굵은 그러나 명확한 마스크를 생성한다.
- 글로벌 사활성 지도 브랜치만으로는 정밀한 세분화가 가능하지만 겹치는 경우에선 아티팩트를 유발하여 실패한다.
- 두 브랜치의 조합은 복잡한 상황에서 최신 기술 수준의 성능을 달성하여 정확한 인스턴스 분리와 고품질의 마스크 경계를 동시에 가능하게 한다.
- FCOS에 통합된 CenterMask-FCOS는 ResNeXt-101-FPN-DCN을 사용해 COCO test-dev에서 38.5 mAP를 달성하며, PolarMask를 초월하고 더 높은 품질의 애너테이션을 가진 LVIS에서 Mask R-CNN과 동등한 성능을 보였다.
- LVIS 벤치마크에서 CenterMask-FCOS는 ResNeXt-101-FPN-DCN을 사용해 40.0 mAP를 달성하여, 동일한 데이터셋에서 Mask R-CNN의 36.0 mAP를 능가했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.