[논문 리뷰] Weakly Supervised Semantic Segmentation by Pixel-to-Prototype Contrast
이 논문은 이미지 수준 분류와 픽셀 수준 분할 간의 지도 학습 갭을 줄이기 위해 픽셀-프로토타입 대비 학습을 사용하는 약한 지도 학습 세그멘테이션 방법을 제안한다. 프로토타입 기반 대비 학습을 통해 시각 간 특징 일관성과 동일 클래스 내 밀도를 강제함으로써, 기본 네트워크를 수정하거나 추론 비용을 추가하지 않고도 PASCAL VOC 2012에서 세그멘테이션 mIoU를 최대 6.13% 향상시키며 시 sematic segmentation 품질을 향상시킨다.
Though image-level weakly supervised semantic segmentation (WSSS) has achieved great progress with Class Activation Maps (CAMs) as the cornerstone, the large supervision gap between classification and segmentation still hampers the model to generate more complete and precise pseudo masks for segmentation. In this study, we propose weakly-supervised pixel-to-prototype contrast that can provide pixel-level supervisory signals to narrow the gap. Guided by two intuitive priors, our method is executed across different views and within per single view of an image, aiming to impose cross-view feature semantic consistency regularization and facilitate intra(inter)-class compactness(dispersion) of the feature space. Our method can be seamlessly incorporated into existing WSSS models without any changes to the base networks and does not incur any extra inference burden. Extensive experiments manifest that our method consistently improves two strong baselines by large margins, demonstrating the effectiveness. Specifically, built on top of SEAM, we improve the initial seed mIoU on PASCAL VOC 2012 from 55.4% to 61.5%. Moreover, armed with our method, we increase the segmentation mIoU of EPS from 70.8% to 73.6%, achieving new state-of-the-art.
연구 동기 및 목표
- 약한 지도 학습 세그멘테이션(WSSS)에서 이미지 수준 분류와 픽셀 수준 분할 간의 지도 학습 갭을 해결한다.
- CAM 기반 초기 시드 마스크 품질을 향상시키기 위해 픽셀 수준의 지도 신호를 도입한다.
- 기본 네트워크를 수정하지 않고도 SEAM 및 EPS와 같은 강력한 베이스라인에서 일관된 성능 향상을 가능하게 한다.
- 시각 간 특징 일관성과 클래스 내 밀도를 강제하는 대비 학습 프레임워크를 개발한다.
제안 방법
- 각 픽셀을 그들의 양성 프로토타입 쪽으로 끌어당기고 부정적 프로토타입에서 밀어내는 통합된 픽셀-프로토타입 대비 학습 공식을 제안한다.
- 프로토타입을 각 클래스의 대표 임베딩으로 정의하며, CAM에서 상위 활성화를 보인 픽셀들로부터 추정한다.
- 동시적으로 시각 간(크로스-뷰) 및 각 시각 내(인트라-뷰)에서 대비 학습을 수행하여 특징 공간의 일관성과 밀도를 정규화한다.
- 과도하거나 저활성화된 CAM 영역으로 인한 노이즈 대비를 줄이기 위해 반경형 프로토타입 마이닝과 하드 픽셀 샘플링을 도입한다.
- 경량 프로젝터를 통한 기존 WSSS 프레임워크에 통합하여 기본 네트워크를 수정할 필요 없이 추론 비용도 추가하지 않는다.
- 스케일링, 플립, 회전, 이동 등의 공간 변환을 사용하여 크로스-뷰를 위한 다수의 시각을 생성한다.
실험 결과
연구 질문
- RQ1픽셀-프로토타입 대비 학습은 이미지 수준 WSSS에서 지도 학습 갭을 효과적으로 줄일 수 있는가?
- RQ2크로스-뷰 및 인트라-뷰 대비 학습이 함께 작용할 때, 시드 마스크 품질과 세그멘테이션 성능은 어떻게 향상되는가?
- RQ3제안된 방법은 아키텍처 변경 없이 SEAM 및 EPS와 같은 최신 WSSS 모델의 성능을 어느 정도 향상시킬 수 있는가?
- RQ4프로토타입 수(K)와 같은 하이퍼파라미터 선택에 대해 이 방법은 얼마나 강건한가?
주요 결과
- SEAM에 적용했을 때 PASCAL VOC 2012에서 초기 시드 mIoU를 55.4%에서 61.5%로 향상시켜 6.13% 향상되었다.
- EPS에 적용했을 때 세그멘테이션 mIoU를 70.8%에서 73.6%로 향상시켜 새로운 최고 성능을 달성했다.
- 절단 실험을 통해 크로스-프로토타입 대비, 크로스-CAM 대비, 인트라-뷰 대비, 프로토타입 마이닝, 하드 픽셀 샘플링 각 요소가 성능 향상에 기여한다는 것이 확인되었다.
- K의 선택에 대해 강건하며, 최적 성능은 K=32에서 나타나 훈련 세트에서 61.54% mIoU를 달성했다.
- 다양한 공간 변환(스케일링, 플립, 회전, 이동)을 포함할 경우 약간의 성능 향상이 있었으며, 모든 변환을 사용했을 때 가장 좋은 결과로 61.63% mIoU를 기록했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.