Skip to main content
QUICK REVIEW

[논문 리뷰] Complementary Patch for Weakly Supervised Semantic Segmentation

Fei Zhang, Chaochen Gu|arXiv (Cornell University)|2021. 08. 09.
Advanced Neural Network Applications참고 문헌 43인용 수 9
한 줄 요약

이 논문은 이미지 수준 레이블만을 사용하여 약한 지도 학습 세그멘테이션을 향상시키기 위해 보완 패치(Complementary Patch, CP) 표현과 CP 네트워크(CPN)를 제안한다. 정보 이론을 활용하여, 상보적인 숨겨진 패치를 가진 이미지 쌍을 이용해 더 정보가 풍부한 CAMs를 생성함으로써, VOC 2012 검증 세트에서 67.8%의 최신 기준 mIoU를 달성하고, CRF 정제를 적용한 테스트 세트에서는 68.5%를 기록한다.

ABSTRACT

Weakly Supervised Semantic Segmentation (WSSS) based on image-level labels has been greatly advanced by exploiting the outputs of Class Activation Map (CAM) to generate the pseudo labels for semantic segmentation. However, CAM merely discovers seeds from a small number of regions, which may be insufficient to serve as pseudo masks for semantic segmentation. In this paper, we formulate the expansion of object regions in CAM as an increase in information. From the perspective of information theory, we propose a novel Complementary Patch (CP) Representation and prove that the information of the sum of the CAMs by a pair of input images with complementary hidden (patched) parts, namely CP Pair, is greater than or equal to the information of the baseline CAM. Therefore, a CAM with more information related to object seeds can be obtained by narrowing down the gap between the sum of CAMs generated by the CP Pair and the original CAM. We propose a CP Network (CPN) implemented by a triplet network and three regularization functions. To further improve the quality of the CAMs, we propose a Pixel-Region Correlation Module (PRCM) to augment the contextual information by using object-region relations between the feature maps and the CAMs. Experimental results on the PASCAL VOC 2012 datasets show that our proposed method achieves a new state-of-the-art in WSSS, validating the effectiveness of our CP Representation and CPN.

연구 동기 및 목표

  • 이미지의 희박한 활성화로 인해 완전한 객체 영역을 놓치는 Class Activation Maps (CAMs)의 한계를 해결하기 위해.
  • 반복적인 영역 제거 또는 마스킹 방법의 비효율성과 불안정성을 해결하기 위해 원리적인 정보 이론 기반 접근법을 도입하기 위해.
  • 숨겨진(패치된) 영역이 있는 이미지 쌍에서의 상보적 정보를 활용하여 CAM 품질을 향상시키고, 시드 영역 탐지 능력을 향상시키기 위해.
  • 원본 CAM과 향상된 CAM 간의 격차를 최소화하기 위한 트리플릿 아키텍처와 정규화를 갖춘 새로운 CP 네트워크(CPN)를 개발하기 위해.
  • 특징과 객체 영역 간의 맥락적 관계를 더 잘 포착하기 위해, 피그먼트-영역 상관관계 모듈(PRCM)을 사용하여 세그멘테이션 예측을 정제하기 위해.

제안 방법

  • 정보 이론에 기반한 보완 패치(CP) 표현을 제안하고, CP 쌍(상보적인 숨겨진 패치를 가진 두 이미지)의 CAM 합이 원본 CAM보다 더 많은 정보를 포함한다는 것을 증명한다.
  • 원본 CAM과의 격차를 최소화하기 위해 트리플릿 손실(Triple CP, TCP)과 CP 교차 정규화(CP Cross Regularization, CPCR)를 사용한 CP 네트워크(CPN)를 설계한다.
  • 패치 템플릿을 격자 기반 또는 슈퍼픽셀 기반으로 사용하여 숨겨진 영역 분포를 제어하고 상보성을 보장한다.
  • 특징맵 픽셀과 객체 영역 간의 관계를 모델링하는 피그먼트-영역 상관관계 모듈(PRCM)을 도입하여 CAM의 일관성과 맥락 인식 능력을 향상시킨다.
  • 무작위 보행(Random Walk)과 CRF 후처리를 사용하여 편의 세그멘테이션 마스크를 추가로 정제하고 최종 mIoU 점수를 향상시킨다.
  • 경계 상자, 스케치, 픽셀 수준의 애너테이션 없이도 이미지 수준 레이블만을 사용하여 모델을 엔드 투 엔드로 훈련시킨다.

실험 결과

연구 질문

  • RQ1상보적인 숨겨진 패치를 가진 두 이미지의 CAM 합은 단일 CAM보다 더 정보가 풍부한 객체 시드 영역을 제공할 수 있는가?
  • RQ2패치 크기와 숨겨진 확률이 CP 프레임워크에서 정보 획득과 세그멘테이션 성능에 어떤 영향을 미치는가?
  • RQ3특정 정규화를 갖춘 트리플릿 기반 네트워크가 CP 쌍을 사용하여 CAM을 효과적으로 향상시킬 수 있는가?
  • RQ4피그먼트-영역 관계를 통합할 경우 CAM 품질과 세그멘테이션 정확도는 어느 정도 향상되는가?
  • RQ5제안된 CPN은 약한 지도 학습 하에서 PASCAL VOC 2012와 같은 표준 벤치마크에서 최신 기준 성능을 달성하는가?

주요 결과

  • 정보 이론에 기반한 이론적 근거를 통해 CP 표현이 타당함을 입증하였으며, CP 쌍의 CAM 합은 원본 CAM보다 적어도 동일한 정보를 포함한다는 것을 증명하였다.
  • CRF 정제를 적용한 결과, PASCAL VOC 2012 검증 세트에서 67.8%의 최신 기준 mIoU를 기록하였고, 테스트 세트에서는 68.5%를 달성하였다.
  • CRF 없이도 검증 세트에서 66.8%의 mIoU, 테스트 세트에서는 67.6%의 mIoU를 기록하여, 추가 지도 학습 없이도 MCIS 및 기타 최신 기준 방법들을 초월하였다.
  • 숨겨진 확률 $p_h$가 너무 낮을 경우(예: 0.1) 성능이 저하됨을 관찰하여, 이론적 극한 케이스(즉, CP 쌍의 한 이미지가 원본과 거의 동일해지는 경우)를 검증하였다.
  • 격자 기반 패치는 슈퍼픽셀 패치보다 훨씬 빠르며(0.006 sec/image), 실시간 응용에 더 적합하다(1.45 sec/image).
  • 피그먼트-영역 상관관계 모듈(PRCM)은 특징과 객체 영역 간의 맥락적 관계를 모델링하여 CAM의 일관성과 세그멘테이션 품질 향상에 기여하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.