[논문 리뷰] Evaluation and Improvement of Interpretability for Self-Explainable Part-Prototype Networks
이 논문은 두 가지 새로운 지표인 일관성 점수와 안정성 점수를 사용하여 부분 프로토타입 네트워크의 해석 가능성에 대한 정량적 벤치마크를 제안한다. 얕은-깊은 특징 정렬(SDFA) 모듈과 점수 집계(SA) 모듈을 갖춘 개선된 ProtoPNet를 도입하여, 세 가지 벤치마크에서 정확도와 해석 가능성 측면에서 최신 기술(SOTA) 성능을 달성하며 프로토타입의 일관성과 강건성에서 뚜렷한 향상을 이룬다.
Part-prototype networks (e.g., ProtoPNet, ProtoTree, and ProtoPool) have attracted broad research interest for their intrinsic interpretability and comparable accuracy to non-interpretable counterparts. However, recent works find that the interpretability from prototypes is fragile, due to the semantic gap between the similarities in the feature space and that in the input space. In this work, we strive to address this challenge by making the first attempt to quantitatively and objectively evaluate the interpretability of the part-prototype networks. Specifically, we propose two evaluation metrics, termed as consistency score and stability score, to evaluate the explanation consistency across images and the explanation robustness against perturbations, respectively, both of which are essential for explanations taken into practice. Furthermore, we propose an elaborated part-prototype network with a shallow-deep feature alignment (SDFA) module and a score aggregation (SA) module to improve the interpretability of prototypes. We conduct systematical evaluation experiments and provide substantial discussions to uncover the interpretability of existing part-prototype networks. Experiments on three benchmarks across nine architectures demonstrate that our model achieves significantly superior performance to the state of the art, in both the accuracy and interpretability. Our code is available at https://github.com/hqhQAQ/EvalProtoPNet.
연구 동기 및 목표
- 기존 부분 프로토타입 네트워크에서 해석 가능성에 대한 객관적이고 정량적인 평가가 부족한 문제를 해결하기 위해, 주로 주관적인 시각화나 인간 평가에 의존하고 있다.
- 해석 가능성의 핵심 결함인 일관성(다른 이미지에서 동일한 객체 부위에 프로토타입이 매핑되지 않는 현상)과 불안정성(소규모 입력 변형에 따라 프로토타입이 다른 부위에 매핑되는 현상)을 식별하고 정량화하기 위해.
- 데이터셋 수준의 객체 부위 애너테이션을 활용하여 프로토타입의 해석 가능성 평가를 위한 재현 가능하고 객관적인 평가 프레임워크를 개발하기 위해.
- 프로토타입의 일관성과 강건성을 향상시키는 아키텍처 혁신을 통해 부분 프로토타입 네트워크의 해석 가능성 향상하기 위해.
- 정성적 시각화를 넘어서 자율 설명 가능한 모델의 평가 및 발전을 위한 기준 벤치마크 수립하기 위해.
제안 방법
- 지표 기반으로 프로토타입이 다양한 이미지에서 동일한 객체 부위에 일관되게 활성화되는지 측정하는 일관성 점수 지표를 제안하며, 이는 지표 부위 애너테이션과의 공간 정렬 기반으로 한다.
- 소규모 입력 변형(예: 적대적 또는 자연스러운 변형) 하에서 프로토타입이 동일한 객체 부위에 얼마나 일관되게 활성화되는지를 측정하는 안정성 점수 지표를 도입한다.
- 얕은 층과 깊은 층의 특징 맵 간의 공간 유사성 구조를 정렬하기 위해 얕은-깊은 특징 정렬(SDFA) 모듈을 설계하여 깊은 특징에서의 공간 정보를 유지한다.
- 각 카테고리에 할당된 프로토타입 활성화를 집중시키고 다른 카테고리의 간섭을 줄이기 위해 점수 집계(SA) 모듈을 개발한다.
- SDFA 및 SA 모듈을 재설계된 ProtoPNet 아키텍처에 적용하여 특징 표현과 프로토타입 매칭 정확도를 모두 향상시킨다.
- 공선 유사도와 공간 유사도 매칭(식 10을 통해)을 사용하여 얕은 특징과 깊은 특징 간의 구조적 정렬을 계산하며, 이 유사도 지표는 $\mathrm{Sim}(t(z_{s}),t(z_{d}))=\frac{1}{\tilde{Z}}\sum\limits_{i=0}^{\tilde{Z}-1}e^{-\|t_{i}(z_{s})-t_{i}(z_{d})\|^{2}}$ 로 정의된다.

실험 결과
연구 질문
- RQ1기존의 부분 프로토타입 네트워크는 다양한 이미지 간에 프로토타입이 동일한 객체 부위에 일관되게 매핑되는가?
- RQ2소규모 입력 변형에 대해 부분 프로토타입 네트워크의 프로토타입은 그 의미적 해석 측면에서 얼마나 강건한가?
- RQ3아키텍처 수정을 통해 부분 프로토타입 기반 설명의 일관성과 안정성을 향상시킬 수 있는가?
- RQ4제안된 평가 지표(일관성 점수 및 안정성 점수)는 정성적 평가나 인간 기반 해석 평가와 비교해 어떻게 다른가?
- RQ5특징 정렬과 점수 집계의 영향은 부분 프로토타입 네트워크의 전체 정확도와 해석 가능성에 어떤가?
주요 결과
- 제안된 일관성 점수 및 안정성 점수 지표는 기존 부분 프로토타입 네트워크의 해석 가능성 결함을 성공적으로 정량화하며, 프로토타입이 이미지 간에 신뢰할 수 있는 의미적 대응을 가지지 못함을 드러낸다.
- SDFA 모듈은 얕은 특징과 깊은 특징 맵 간의 공간 유사성 정렬을 크게 향상시켜, CUB-200-2011 데이터셋에서 ResNet34 기준으로 유사도 점수를 12.4%에서 70.8%로 상승시켰다.
- SA 모듈은 Dense121에서 다른 카테고리의 유사한 프로토타입 수를 최대 5.6점 감소시켜(6.2에서 11.8로), 카테고리 간 간섭을 감소시켰다.
- SDFA 및 SA 모듈을 모두 포함한 전체 모델은 최신 기술(SOTA) 성능을 달성하였으며, ResNet34 기준 일관성 점수에서 58.4% 향상, ResNet152 기준 51.5% 향상되었다.
- 시각화 결과는 제안된 모델에서 프로토타입이 훈련 및 테스트 이미지 전반에 걸쳐 동일한 객체 부위(예: 머리)에 일관되게 활성화되는 반면, 기준 모델은 비정상적이고 일관되지 않은 주의를 보임을 확인한다.
- 이 방법은 세 가지 벤치마크(CUB-200-2011, Stanford Cars, PartImageNet)에서 기존 부분 프로토타입 네트워크를 초월하여 뛰어난 정확도와 해석 가능성을 입증하였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.