[논문 리뷰] Weak-shot Semantic Segmentation via Dual Similarity Transfer
이 논문은 COCO-Stuff-10K 및 ADE20K에서 최고 성능을 기록하는, 기본 클래스의 픽셀 수준의 애너테이션과 신규 클래스의 이미지 수준 레이블을 활용하는 이중 유사도 전이 프레임워크인 SimFormer을 제안한다. 기본 클래스에서 신규 클래스로 제안-픽셀 유사도를 전이하고, 클래스에 의존하지 않는 픽셀-픽셀 유사도를 희석함으로써, 완전한 지도 학습 없이도 정확한 마스크 예측이 가능해지며, 이는 약한 샘플 수 세분화에서 최신 기술 수준에 도달한다.
Semantic segmentation is an important and prevalent task, but severely suffers from the high cost of pixel-level annotations when extending to more classes in wider applications. To this end, we focus on the problem named weak-shot semantic segmentation, where the novel classes are learnt from cheaper image-level labels with the support of base classes having off-the-shelf pixel-level labels. To tackle this problem, we propose SimFormer, which performs dual similarity transfer upon MaskFormer. Specifically, MaskFormer disentangles the semantic segmentation task into two sub-tasks: proposal classification and proposal segmentation for each proposal. Proposal segmentation allows proposal-pixel similarity transfer from base classes to novel classes, which enables the mask learning of novel classes. We also learn pixel-pixel similarity from base classes and distill such class-agnostic semantic similarity to the semantic masks of novel classes, which regularizes the segmentation model with pixel-level semantic relationship across images. In addition, we propose a complementary loss to facilitate the learning of novel classes. Comprehensive experiments on the challenging COCO-Stuff-10K and ADE20K datasets demonstrate the effectiveness of our method. Codes are available at https://github.com/bcmi/SimFormer-Weak-Shot-Semantic-Segmentation.
연구 동기 및 목표
- 픽셀 수준 마스크의 높은 애너테이션 비용 문제를 해결하기 위해, 더 저렴한 이미지 수준의 레이블로부터 신규 클래스의 학습을 가능하게 한다.
- 기존 방법들이 배경 클래스 마스크가 필요하거나 오프더셀프 데이터셋에서 신규 클래스를 배제하는 한계를 극복한다.
- 실제 응용 분야에서 데이터셋 확장을 위한 실용적이고 확장 가능한 프레임워크를 개발한다.
- 유사도 전이와 구조적 정규화를 통해 신규 클래스의 마스크 품질을 향상시킨다.
제안 방법
- MaskFormer를 수정하여 세분화를 제안 분류 및 제안 세분화 하위 작업으로 분리한다.
- 기본 클래스에서 신규 클래스로 제안-픽셀 유사도를 전이하여, 지도 마스크 없이도 마스크 예측이 가능하도록 한다.
- 기본 클래스로부터 클래스에 의존하지 않는 픽셀-픽셀 유사도를 학습하고 희석하여, 이미지 간 세분적 관계를 정규화한다.
- 신규 클래스 제안의 정확한 할당을 장려함으로써 마스크 학습을 향상시키기 위해 보완 손실을 도입한다.
- 기준 이미지와 쿼리 이미지 간 픽셀 수준의 유사도를 추정하기 위해 학습 가능한 유사도 네트워크(SimNet)를 사용한다.
- 기본 클래스에서 신규 클래스로 픽셀-픽셀 유사도를 전이하기 위해 지식 희석을 적용하여 일반화 및 강인성을 향상시킨다.
실험 결과
연구 질문
- RQ1기본 클래스에서의 제안-픽셀 유사도 전이가 이미지 수준의 지도만으로도 신규 클래스의 마스크를 효과적으로 예측할 수 있는가?
- RQ2기본 클래스로부터 학습된 클래스에 의존하지 않는 픽셀-픽셀 유사도가 신규 클래스의 세분화 품질과 일반화 능력을 향상시키는가?
- RQ3약한 샘플 수 설정에서 이중 유사도 전이가 단일 지도 학습 또는 기준 기반 소수 샘플 방법보다 어떻게 비교되는가?
- RQ4보완 손실이 신규 클래스의 마스크 학습과 모델 강인성에 미치는 영향은 무엇인가?
- RQ5더 많은 신규 클래스로 확장하거나 실제 세계의 데이터셋 확장 시나리오에서 이 방법의 일반화 능력은 어느 정도인가?
주요 결과
- SimFormer는 COCO-Stuff-10K 및 ADE20K에서 기존의 약한 샘플 수 및 소수 샘플 방법을 능가하는 최고 성능을 기록한다.
- 보완 손실만으로도 COCO-Stuff-10K에서 mIoU가 1.8% 향상되어, 신규 클래스 마스크 학습 유도에 효과적임을 입증한다.
- 이중 유사도 전이(제안-픽셀 및 픽셀-픽셀)는 COCO-Stuff-10K에서 기준 방법 대비 3.2%의 mIoU 향상을 이룬다.
- 모델은 하이퍼파ram터 β와 γ에 대해 강인하며, 합리적인 값 범위 내에서 성능이 안정적이다.
- 시각화 결과는 전이된 픽셀-픽셀 유사도가 작은 객체나 세분화된 객체조차도 의미 있는 세분적 관계를 포착함을 확인한다.
- 실패 사례는 세분화된 클래스에 대한 제안 분류의 한계와 작은 객체에 대한 약한 지도 학습의 한계를 드러내며, 주의 메커니즘과 정렬의 향상 여지를 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.