[논문 리뷰] PolarMask++: Enhanced Polar Representation for Single-Shot Instance Segmentation and Beyond
PolarMask++는 객체 마스크를 중심점과 반경 거리로 표현하는 극좌표 기반 방식을 사용하여 앵커 박스 없고 단일 스테이지 인스턴스 세그멘테이션 프레임워크를 제안한다. 이는 인스턴스 세그멘테이션과 기울어진 객체 검출을 통합한다. 소프트 폴라 센터리스와 폴라 IoU 손실을 도입함으로써 COCO, 텍스트 검출, 세포 세그멘테이션에서 최고 성능을 달성하며, 계산량이 최소화되고 실시간 추론이 가능하다.
Reducing the complexity of the pipeline of instance segmentation is crucial for real-world applications. This work addresses this issue by introducing an anchor-box free and single-shot instance segmentation framework, termed PolarMask, which reformulates the instance segmentation problem as predicting the contours of objects in the polar coordinate, with several appealing benefits. (1) The polar representation unifies instance segmentation (masks) and object detection (bounding boxes) into a single framework, reducing the design and computational complexity. (2) Two modules are carefully designed (i.e. soft polar centerness and polar IoU loss) to sample high-quality center examples and optimize polar contour regression, making the performance of PolarMask does not depend on the bounding box prediction results and thus becomes more efficient in training. (3) PolarMask is fully convolutional and can be easily embedded into most off-the-shelf detection methods. To further improve the accuracy of the framework, a Refined Feature Pyramid is introduced to further improve the feature representation at different scales, termed PolarMask++. Extensive experiments demonstrate the effectiveness of both PolarMask and PolarMask++, which achieve competitive results on instance segmentation in the challenging COCO dataset with single-model and single-scale training and testing, as well as new state-of-the-art results on rotate text detection and cell segmentation. We hope the proposed polar representation can provide a new perspective for designing algorithms to solve single-shot instance segmentation. The codes and models are available at: github.com/xieenze/PolarMask.
연구 동기 및 목표
- 앵커 박스가 필요 없고 이중 스테이지 검출이 필요 없는 단순화된 인스턴스 세그멘테이션 파이프라인을 제공하기 위해.
- 극좌표 기반 표현을 사용하여 인스턴스 세그멘테이션과 기울어진 객체 검출을 단일 엔드 투 엔드 프레임워크로 통합하기 위해.
- 경량 후처리 보정 모듈을 통해 비정상적인 형태의 객체에 대한 마스크 정확도를 향상시키기 위해.
- 계산량을 최소화하면서도 표준 벤치마크에서 높은 정확도를 유지하면서 실시간 추론을 가능하게 하기 위해.
제안 방법
- 객체 마스크를 중심점과 다수의 각도 간격에서의 레이 길이로 정의하는 극좌표 기반의 윤곽으로 표현한다.
- 경계 상자 예측에 의존하지 않고 고품질 중심점을 샘플링하기 위해 소프트 폴라 센터리스를 도입한다.
- 윤곽 회귀를 직접 최적화하여 일반화 능력을 향상시키고 경계 상자 헤드에 대한 의존도를 줄이기 위해 폴라 IoU 손실을 제안한다.
- 다양한 객체 크기에서의 다중 척도 특징 표현을 향상시키기 위해 개선된 특징 피라미드 네트워크(RFPN)를 활용한다.
- 비정상적인 형태의 마스크에 특히 유리하게 작용하도록, 거친 폴라 마스크를 보정하기 위해 경량 후처리 전치 신경망(FCN)을 적용한다.
- 기존 단일 스테이지 검출기와 쉽게 통합할 수 있도록 전치 신경망 아키텍처를 사용한다.
실험 결과
연구 질문
- RQ1경계 상자 기반 접근 방식에 비해 극좌표 표현 방식이 인스턴스 세그멘테이션과 기울어진 객체 검출을 더 효과적으로 통합할 수 있는가?
- RQ2기존 카르테시안 기반 마스크 예측 방식과 비교했을 때, 극좌표 표현은 혼잡하거나 기울어진 객체 상황에서 성능을 어떻게 향상시키는가?
- RQ3소프트 폴라 센터리스와 폴라 IoU 손실이 경계 상자 예측에 대한 의존도를 얼마나 줄이고 학습 효율성을 향상시키는가?
- RQ4경량 FCN를 통한 마스크 보정이 비정상적인 형태의 객체에 대해 정확도를 크게 향상시키면서도 속도를 손상시키지 않는가?
- RQ5제안된 프레임워크는 COCO와 텍스트, 세포 세그멘테이션과 같은 전용 벤치마크에서 단일 모델, 단일 스케일 추론로 최고 성능을 달성할 수 있는가?
주요 결과
- PolarMask++는 단일 모델, 단일 스케일 추론에서 COCO 인스턴스 세그멘테이션에서 34.1 mAP를 달성하여 기반 모델 대비 3.9점 향상되었다.
- 마스크 보정 FCN는 mAP를 30.2에서 34.1로 상승시켰으며, 사람(37.8 → 43.2 AP)과 동물과 같은 비정상적인 형태의 객체에서 가장 큰 향상이 관찰되었다.
- 공구형 형태의 객체인 볼, 컵, 시계와 같은 경우 마스크 보정으로 인한 성능 저하가 거의 없거나 약간의 감소를 보였으며, 이는 대칭형 형태에 대해 극좌표 표현의 강점을 확인한다.
- 보정 모듈은 추론 시간에 1개의 객체당 추가로 1.5ms가 소요되며, 실시간 응용에 실용적이다.
- ResNeXt-101을 백본으로 사용할 경우 ResNet-50 대비 mAP가 2.3% 향상되었으며, 더 깊고 강력한 백본의 이점이 입증되었다.
- PolarMask++는 480×480 입력 해상도에서 단일 V100 GPU에서 47.9 FPS를 기록하여 실시간 배포 잠재력을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.