[논문 리뷰] Extracting Class Activation Maps from Non-Discriminative Features as well
이 논문은 국소적 특징을 프로토타입으로 군집화하여 분류 기준이 되는 국소적 특징과 비분류 기준이 되는 국소적 특징을 모두 포착하는 새로운 방법인 로컬 프로토타입 CAM(LPCAM)을 제안한다. 표준 분류기 가중치를 프로토타입 기반 유사도 맵으로 대체하고 각 프로토타입 별로 개별 정규화를 적용함으로써, 약한 지도 학습 세그멘테이션에서 완전한 객체 커버리지를 달성하며, 계산 오버헤드를 최소화하면서 PASCAL VOC 및 MS COCO에서 최신 기술을 능가한다.
Extracting class activation maps (CAM) from a classification model often results in poor coverage on foreground objects, i.e., only the discriminative region (e.g., the "head" of "sheep") is recognized and the rest (e.g., the "leg" of "sheep") mistakenly as background. The crux behind is that the weight of the classifier (used to compute CAM) captures only the discriminative features of objects. We tackle this by introducing a new computation method for CAM that explicitly captures non-discriminative features as well, thereby expanding CAM to cover whole objects. Specifically, we omit the last pooling layer of the classification model, and perform clustering on all local features of an object class, where "local" means "at a spatial pixel position". We call the resultant K cluster centers local prototypes - represent local semantics like the "head", "leg", and "body" of "sheep". Given a new image of the class, we compare its unpooled features to every prototype, derive K similarity matrices, and then aggregate them into a heatmap (i.e., our CAM). Our CAM thus captures all local features of the class without discrimination. We evaluate it in the challenging tasks of weakly-supervised semantic segmentation (WSSS), and plug it in multiple state-of-the-art WSSS methods, such as MCTformer and AMN, by simply replacing their original CAM with ours. Our extensive experiments on standard WSSS benchmarks (PASCAL VOC and MS COCO) show the superiority of our method: consistent improvements with little computational overhead.
연구 동기 및 목표
- 기존의 클래스 활성화 맵(CAMs)이 일반적으로 비분류 기준 영역(예: 객체의 다리, 꼬리)을 놓치는 데 기인한 전경 객체 커버리지가 열악한 문제를 해결하기 위해.
- 표준 CAMs가 분류 기준 특징에만 편향되는 문제를 해결하기 위해 분류기 가중치를 프로토타입 기반 표현으로 대체하기 위해.
- 국소적 의미(예: '머리', '다리', '몸통')를 유지하면서 혼동되는 맥락(예: '기차'에 대해 '레일')으로 인한 오분류를 줄이기 위해.
- 기존 CAMs의 플러그인 대체 방법으로, 세그멘테이션 모델의 아키텍처 변경 없이도 약한 지도 학습 세그멘테이션(WSSS) 성능을 향상시키며, 계산 비용을 최소화하기 위해.
제안 방법
- 최종 분류기 이전의 모든 공간적으로 국소화된 특징을 유지하기 위해 분류 모델에서 전역 평균 풀링 레이어를 생략한다.
- 모든 훈련 이미지의 국소적 특징을 K개의 국소 프로토타입으로 군집화하여, 각각이 별개의 국소적 의미적 부분(예: '양'의 '머리', '다리')을 대표하도록 한다.
- 주어진 이미지에 대해 코사인 거리 기반으로 특징 맵과 각 국소 프로토타입 간의 K개의 유사도 맵을 계산하고, 각 맵 별로 개별 정규화를 적용함으로써 비분류 기준 영역을 유지한다.
- 정규화된 유사도 맵을 평균하여 최종 히트맵을 생성하고, 이를 로컬 프로토타입 CAM(LPCAM)으로 간주한다.
- 허용 가능한 배경 요소와 유사도 맵을 빼내어 강하게 공존하는 배경 요소로 인한 오분류를 억제하기 위해 LPCAM을 확장한다.
- 세그멘테이션 파이프라인에 기존의 CAM 계산 단계를 대체함으로써 LPCAM을 통합하며, 세그멘테이션 모델의 아키텍처 변경 없이 구현한다.

실험 결과
연구 질문
- RQ1풀링되지 않은 특징에서 유도된 프로토타입 기반 분류기로 기존 분류기 가중치에 비해 CAM의 객체 커버리지가 향상되는가?
- RQ2각 프로토타입 기반 유사도 맵 별로 개별 정규화를 적용할 경우, 기존 CAM이 무시하는 비분류 기준 특징이 유지되는가?
- RQ3LPCAM은 혼동되는 맥락(예: '기차'에 대해 '레일')으로 인한 오분류를 어느 정도 줄일 수 있으며, 동시에 완전한 객체 커버리지를 유지할 수 있는가?
- RQ4다양한 백본 및 사전 학습 전략을 사용하는 최신 기술 기반 WSSS 방법들에 LPCAM을 통합했을 때 성능은 어떠한가?
주요 결과
- AMN와 함께 사용했을 때, PASCAL VOC 2012 검증 세트에서 70.1% mIoU, 테스트 세트에서 70.4% mIoU를 기록하여 최신 기술 성능을 달성한다.
- 더 도전적인 MS COCO 데이터셋에서, AMN+LPCAM은 원본 AMN 및 이전 최신 기술 메서드를 모두 능가하며, WRN-38 기반으로 45.5% mIoU를 기록한다.
- IRN, MCTformer, EDAM 등 다양한 WSSS 방법에서 mIoU를 0.6–0.8%p 향상시키며, VOC 및 COCO 양쪽 모두에서 일관된 성능 향상을 보였다.
- 감도 분석 결과 LPCAM은 하이퍼파라미터 변화에 뛰어나게 강건하며, 특징 선택 및 군집화에 대한 다양한 임계값 설정에서도 성능 저하가 최소한이다.
- 정성적 결과 분석을 통해 LPCAM은 비분류 기준 부분(예: 다리, 꼬리)을 포착하고 맥락 오류(예: '서피스보드' 이미지에서 '파도')를 억제하는 것으로 나타났으며, 일부 경우 '기차'와 함께 강하게 공존하는 '철도'와 같은 맥락에서는 과도하게 활성화되는 경향이 있었다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.