[논문 리뷰] Explaining Convolutional Neural Networks through Attribution-Based Input Sampling and Block-Wise Feature Aggregation
이 논문은 CNN의 시각적 설명 가능성(Explainability)을 향상시키기 위해 다중 중간 합성곱 블록에서 얻은 속성 기반 입력 샘플링 맵을 집계하는 새로운 XAI 방법 SISE를 제안한다. 이로 인해 고해상도, 클래스 구분 능력이 뛰어난 설명 맵을 얻을 수 있으며, 레이어별 특징 속성의 조합 전략과 정교한 융합 메커니즘을 통해 자연 이미지 및 산업용 데이터셋에서 최신 기술 대비 높은 시각적 품질과 완전성의 설명 성능을 달성한다.
As an emerging field in Machine Learning, Explainable AI (XAI) has been offering remarkable performance in interpreting the decisions made by Convolutional Neural Networks (CNNs). To achieve visual explanations for CNNs, methods based on class activation mapping and randomized input sampling have gained great popularity. However, the attribution methods based on these techniques provide lower resolution and blurry explanation maps that limit their explanation power. To circumvent this issue, visualization based on various layers is sought. In this work, we collect visualization maps from multiple layers of the model based on an attribution-based input sampling technique and aggregate them to reach a fine-grained and complete explanation. We also propose a layer selection strategy that applies to the whole family of CNN-based models, based on which our extraction framework is applied to visualize the last layers of each convolutional block of the model. Moreover, we perform an empirical analysis of the efficacy of derived lower-level information to enhance the represented attributions. Comprehensive experiments conducted on shallow and deep models trained on natural and industrial datasets, using both ground-truth and model-truth based evaluation metrics validate our proposed algorithm by meeting or outperforming the state-of-the-art methods in terms of explanation ability and visual quality, demonstrating that our method shows stability regardless of the size of objects or instances to be explained.
연구 동기 및 목표
- 기존 CNN XAI 방법에서의 낮은 공간 해상도와 불완전한 속성 기여도 문제를 해결하기 위해.
- 최종 합성곱 레이어에만 의존하는 것이 아니라, 다수의 중간 레이어에서의 특징을 활용하여 설명 품질을 향상시키기 위해.
- 모든 피드포워드 CNN 아키텍처에 일반화 가능한 레이어 선택 전략을 개발하기 위해.
- 속성 기반 입력 샘플링과 특징 융합을 통해 설명 맵의 시각적 명확성과 완전성을 향상시키기 위해.
- 다양한 데이터셋과 모델에서 기준 진짜값 기반 및 모델 기반 평가 지표를 사용하여 방법의 타당성을 검증하기 위해.
제안 방법
- 해당 방법은 기울기 민감도를 기반으로 주요 입력 영역을 식별하는 속성 기반 입력 샘플링 기법을 사용하여 중간 합성곱 블록에서 시각화 맵을 추출한다.
- 모든 피드포워드 CNN 아키텍처에 대해 가장 정보가 풍부한 중간 블록을 식별하기 위해 레이어 선택 전략을 제안하며, 이는 포괄적인 특징 커버리지를 보장한다.
- 선택된 레이어의 특징 맵은 기울기 기반 속성 기법을 통해 픽셀 수준의 관련성 점수를 계산한다.
- 융합 모듈은 레이어별 속성 맵을 학습된 또는 가중치가 부여된 선형 조합 방식으로 융합하여 정교화된 고해상도 설명 맵을 생성한다.
- 모든 입력 샘플에서 상위 15% 영향력이 큰 픽셀을 선택하기 위해 임계값 함수를 적용하며, 이는 펌터베이션 기반 평가 지표 계산에 사용된다.
- 프레임워크는 공간 정밀도와 클래스 분류 능력을 향상시키기 위해 의미 수준의 관련 특징에 집중하는 수정된 스코어-캠 유사 융합 전략을 적용한다.
실험 결과
연구 질문
- RQ1다중 레이어 특징 융합은 CNN의 설명 맵 해상도와 완전성 향상에 기여하는가?
- RQ2다양한 CNN 아키텍처에서 의미 있는 중간 표현을 추출하기 위해 일반화 가능한 레이어 선택 전략을 어떻게 설계할 수 있는가?
- RQ3속성 기반 입력 샘플링은 무작위 펌터베이션 방법에 비해 설명 품질과 계산 효율성 측면에서 뛰어나다고 할 수 있는가?
- RQ4저수준 특징은 최종 설명에 얼마나 기여하는가? 그리고 고수준 특징과 효과적으로 융합할 수 있는가?
- RQ5제안된 방법은 자연 이미지 및 산업용 이상 탐지 데이터셋 모두에서 뛰어난 성능을 달성할 수 있는가?
주요 결과
- SISE는 모델 기반 평가 지표를 사용하여 ResNet-101에서 Drop% 61.06과 Increase% 15.64를 기록하며, Grad-CAM(67.44/12.46), Grad-CAM++(64.10/12.96), RISE(63.25/15.63), Score-CAM(64.29/10.35)을 모두 초월한다.
- ResNet-50에서 Tesla T4 GPU에서 9.21초의 실행 시간을 기록하며, RISE(26.08초)와 Extremal Perturbation(78.37초)보다 훨씬 빠르면서도 높은 품질의 설명을 유지한다.
- 제거 실험 결과, 속성 매트릭스 수를 1900에서 μ = 0.3으로 설정하여 200으로 줄였을 때 경계 품질에 미미한 영향만 미치며, 실행 시간은 2.18초로 감소한다.
- μ를 0.5로 더 높여 실행 시간을 0.65초로 줄였을 때도 성능 저하가 미미하여, 저기울기 특징 매트릭스는 기여도가 미미하며 안전하게 무시할 수 있음을 시사한다.
- 정성적 결과에서는 SISE가 CAM 기반 및 펌터베이션 기반 방법에 비해 더 선명하고 국소화된 설명 맵을 생성함을 확인했으며, 특히 객체 경계를 구분하는 데 뛰어난 성능을 보였다.
- 입력 스케일에 관계없이 일관된 성능을 보이며, 다양한 객체 크기와 인스턴스 유형에서도 안정적이고 강건한 성능을 나타내었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.