Skip to main content
QUICK REVIEW

[논문 리뷰] Class Activation Map Generation by Representative Class Selection and Multi-Layer Feature Fusion

Fanman Meng, Kaixu Huang|arXiv (Cornell University)|2019. 01. 23.
Domain Adaptation and Few-Shot Learning참고 문헌 22인용 수 10
한 줄 요약

이 논문은 이진 분류를 위한 대표 클래스 선택과 다층 특징 융합을 통해 정위치 정확도를 향상시키는 새로운 클래스 활성화 맵(CAM) 생성 방법을 제안한다. 군집화를 통해 분류 유사도를 기반으로 특징을 분석하고 고수준 및 저수준 특징을 융합함으로써, PASCAL VOC 및 COCO 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성한다. ResNet-101을 사용할 경우 PASCAL VOC 2012에서 33.43%의 mIoU, COCO 2017에서 15.41%의 mIoU를 기록한다.

ABSTRACT

Existing method generates class activation map (CAM) by a set of fixed classes (i.e., using all the classes), while the discriminative cues between class pairs are not considered. Note that activation maps by considering different class pair are complementary, and therefore can provide more discriminative cues to overcome the shortcoming of the existing CAM generation that the highlighted regions are usually local part regions rather than global object regions due to the lack of object cues. In this paper, we generate CAM by using a few of representative classes, with aim of extracting more discriminative cues by considering each class pair to obtain CAM more globally. The advantages are twofold. Firstly, the representative classes are able to obtain activation regions that are complementary to each other, and therefore leads to generating activation map more accurately. Secondly, we only need to consider a small number of representative classes, making the CAM generation suitable for small networks. We propose a clustering based method to select the representative classes. Multiple binary classification models rather than a multiple class classification model are used to generate the CAM. Moreover, we propose a multi-layer fusion based CAM generation method to simultaneously combine high-level semantic features and low-level detail features. We validate the proposed method on the PASCAL VOC and COCO database in terms of segmentation groundtruth. Various networks such as classical network (Resnet-50, Resent-101 and Resnet-152) and small network (VGG-19, Resnet-18 and Mobilenet) are considered. Experimental results show that the proposed method improves the CAM generation obviously.

연구 동기 및 목표

  • 모든 클래스를 비교 대상으로 사용하는 기존 CAM 방법이 국소적이고 비글로벌인 활성화 영역을 유도하는 한계를 해결한다.
  • 보완적인 분류적 단서를 제공하는 소수의 대표 클래스를 선택하여 상호 클래스 간 간섭 문제를 완화한다.
  • 단일 다중 클래스 모델 대신 여러 이진 분류 모델을 사용함으로써 소형 네트워크에서도 효과적인 CAM 생성을 가능하게 한다.
  • 다양한 네트워크 계층에서의 고수준 의미적 특징과 저수준 세부 정보 특징을 융합하여 특징 표현을 향상시킨다.

제안 방법

  • 분류 유사도 행렬을 기반으로 전체 클래스 집합에서 대표 클래스를 선택하기 위한 군집 기반 방법을 제안한다.
  • 클래스 쌍 간의 분류 성능을 바탕으로 유사도 행렬을 구성하여 군집화를 안내한다.
  • 개선된 k-means 군집 알고리즘을 적용하여 상호 보완적인 활성화 단서를 최대화하는 대표 클래스의 부분집합을 식별한다.
  • 각 타겟 클래스를 그 대표 클래스들과 비교하는 다중 이진 분류 모델을 훈련시켜 개별 CAM을 생성한다.
  • CNN의 다양한 계층(예: Layer1에서 Layer4)의 활성화 맵을 융합하는 다층 특징 융합 전략을 도입하여 의미적 정보와 공간적 세부 정보를 모두 유지한다.
  • 대표 클래스 쌍에서 생성된 이진 CAM을 단순 평균화 전략을 통해 융합하여 보다 정확한 최종 활성화 맵을 생성한다.

실험 결과

연구 질문

  • RQ1모든 클래스 대신 소수의 대표 클래스를 선택함으로써 클래스 활성화 맵의 글로벌 정위치 성능을 향상시킬 수 있는가?
  • RQ2비교 대상 클래스의 선택이 생성된 CAM의 분류 적합성과 공간 커버리지에 어떤 영향을 미치는가?
  • RQ3다양한 네트워크 깊이에서의 의미적 정보와 공간 정보를 융합함으로써 다층 특징 융합이 CAM 품질을 향상시킬 수 있는가?
  • RQ4제안된 방법은 MobileNet 및 ResNet-18과 같은 소형 신경망에서도 성능을 유지하거나 향상시킬 수 있는가?
  • RQ5기존의 CAM 생성 기법들인 Grad-CAM, CAM, ACoL, CBAM과 비교했을 때 표준 벤치마크에서 mIoU 측면에서 어떤 성능을 보이는가?

주요 결과

  • 제안된 방법은 PASCAL VOC 2012 검증 세트에서 33.43%의 mIoU를 기록하여 기준선 Grad-CAM 방법(27.94%)과 기타 최신 기술 수준 방법들을 뛰어넘었다.
  • COCO 2017 검증 세트에서는 15.41%의 mIoU를 기록하여 이전 최고 성능 기법(CBAM)을 5个百分点 이상 초월했다.
  • 제거 실험을 통해 다층 융합이 성능을 2.56%포인트 향상시켜(12.85%에서 15.41% mIoU로) 특징 융합의 효과를 입증했다.
  • 이진 분류 모델을 사용함으로써 계산 오버헤드를 줄였기 때문에, MobileNet 및 ResNet-18과 같은 소형 네트워크에서도 우수한 성능을 발휘한다.
  • 대표 클래스 선택을 통해 더 글로벌하게 정위치된 활성화 맵을 생성함을 질적 비교를 통해 확인했으며, 제안된 방법은 전체 객체를 강조하는 반면, 다른 방법은 부분 영역만 강조하는 경향이 있었다.
  • 복잡한 시나리오에서 객체 제거나 주의 분포 오류로 인해 성능 저하를 보이는 ACoL 및 CBAM과 비교해도, 제안된 방법은 COCO 및 PASCAL VOC에서 모두 뛰어난 성능을 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.