[논문 리뷰] Inherently Interpretable Multi-Label Classification Using Class-Specific Counterfactuals
Attri-Net는 예측을 픽셀 수준에서 설명할 수 있는 클래스별 반사적 설명 지ap을 생성하는 새로운 내재적 해석 가능성 다중 레이블 분류 모델이다. 기존의 후행적 방법 및 기준 모델인 CoDA-Nets에 비해 더 뛰어난 클래스 민감도와 임상적으로 일관된 설명을 달성하면서도, 최첨단 흑박상 모델과 동등한 분류 성능 유지를 유지한다.
Interpretability is essential for machine learning algorithms in high-stakes application fields such as medical image analysis. However, high-performing black-box neural networks do not provide explanations for their predictions, which can lead to mistrust and suboptimal human-ML collaboration. Post-hoc explanation techniques, which are widely used in practice, have been shown to suffer from severe conceptual problems. Furthermore, as we show in this paper, current explanation techniques do not perform adequately in the multi-label scenario, in which multiple medical findings may co-occur in a single image. We propose Attri-Net, an inherently interpretable model for multi-label classification. Attri-Net is a powerful classifier that provides transparent, trustworthy, and human-understandable explanations. The model first generates class-specific attribution maps based on counterfactuals to identify which image regions correspond to certain medical findings. Then a simple logistic regression classifier is used to make predictions based solely on these attribution maps. We compare Attri-Net to five post-hoc explanation techniques and one inherently interpretable classifier on three chest X-ray datasets. We find that Attri-Net produces high-quality multi-label explanations consistent with clinical knowledge and has comparable classification performance to state-of-the-art classification models.
연구 동기 및 목표
- 다중 병변이 동시에 존재하는 상황에서 특히 고위험 의료 AI의 충실하고 인간이 이해할 수 있는 설명의 부족 문제를 해결한다.
- 모델의 진정한 의사결정 메커니즘을 반영하지 못할 수 있는 후행적 설명 기법의 개념적 결함과 일관성 부족 문제를 해결한다.
- 설명이 의사결정 과정 자체인 내재적 해석 가능성 모델을 개발하여 충실성과 투명성을 보장한다.
- 반사적 추론을 통합하여 더 임상적으로 의미 있고 국소화된 설명 지도를 생성함으로써 기존의 내재적 해석 가능성 모델을 향상시킨다.
- 제안된 방법이 정량적 및 정성적 평가에서 임상 지식과 일치하고, 후행적 및 기준 내재적 해석 가능성 모델을 모두 능가하는 설명을 생성함을 입증한다.
제안 방법
- 입력 영상에서 각 의료 이상소견의 영향을 실제로 제거하는 클래스별 반사적 이미지를 생성할 수 있는 시각적 특징 설명 생성기를 훈련한다.
- 원본 영상과 반사적 영상 간의 차이를 이용해 각 클래스에 해당하는 영역을 강조하는 픽셀 수준의 설명 지도를 생성한다.
- 생성된 설명 지도에 기반해 최종 예측을 내리는 단순한 로지스틱 회귀 분류기를 적용하여 투명성과 해석 가능성 확보.
- 각 병변의 유무에 민감한 설명을 확보하기 위해 재구성 손실과 클래스별 손실을 사용해 설명 생성기를 최적화한다.
- 설명 지도를 선형 결정 함수에 통합하여, 모델의 예측이 인간이 이해할 수 있는 특징들의 가중합임을 직접적으로 보장한다.
- 입력 영상을 재구성하고 각 클래스의 정확한 설명 지도를 생성하는 다중 작업 학습 설정을 활용한다.

실험 결과
연구 질문
- RQ1반사적 기반 설명 지도는 다중 레이블 의료 영상 분류에서 후행적 설명 기법에 비해 더 충실하고 임상적으로 의미 있는 설명을 제공할 수 있는가?
- RQ2Attri-Net의 클래스 민감도가 뛰어난 내재적 해석 가능성 모델인 CoDA-Nets에 비해 얼마나 뛰어나게 성능을 보이는가?
- RQ3Attri-Net이 생성한 설명 지도가 특정 병변과 관련된 임상적 해부학적 영역과 얼마나 일치하는가?
- RQ4클래스별 반사적 이미지를 사용할 경우, 기울기 기반 또는 변형 기반 방법에 비해 다양한 영상과 병변에서 더 일관되고 신뢰할 수 있는 설명을 제공하는가?
- RQ5내재적 해석 가능성 모델은 최첨단 흑박상 모델과 동등한 분류 정확도를 유지하면서도 투명하고 픽셀 수준의 설명을 제공할 수 있는가?
주요 결과
- Attri-Net은 세 가지 흉부 X-ray 데이터셋 전반에서 CoDA-Nets보다 유의미하게 높은 클래스 민감도를 확보했으며, 평균 민감도 값이 최적의 1.0에 훨씬 더 가까워 병변 유무 영역에 정확히 설명이 국소화된 것으로 나타났다.
- 정량적·정성적 평가에서 Attri-Net은 Guided Backpropagation, GradCAM, LIME, SHAP, Gifsplanation을 포함한 다섯 가지 후행적 설명 기법을 모두 능가했으며, SHAP와 Gifsplanation이 가장 유사했지만 여전히 Attri-Net에 열등했다.
- 정성적 분석 결과, Attri-Net의 설명 지도가 특정 병변(예: 기흉, 축농, 심장비대)과 관련된 해부학적 영역을 명확히 강조했으며, 더 높은 신뢰도 예측에서는 더 집중적이고 정확한 설명을 보였다.
- 반대로 CoDA-Nets는 모든 클래스에서 유사한 외관을 띠는 설명 지도를 생성하여 특이성과 임상적 관련성이 떨어졌다.
- Attri-Net의 설명 지도는 각 클래스별로 상이하게 나타나 서로 다른 해부학적 영역을 집중적으로 반영하여 병변 특징의 효과적인 분리가 이루어졌음을 보여주었다.
- 임상적 경계 상자 외부 영역에서도 Attri-Net은 강력한 설명을 생성했으며, 이는 기존 평가 기준으로는 포착되지 않는 미세한 관련 효과를 감지할 수 있음을 시사하며 임상적으로 유의미할 수 있다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.