[논문 리뷰] Diffusion Models for Counterfactual Explanations
이 논문은 피인과 미세조정 없이 이미지 분류기의 반대설명을 생성하기 위해 사전 훈련된 확산 모델을 활용하는 새로운 방법인 DiME를 제안한다. 분류기 기울기를 사용해 확산 과정을 안내함으로써 DiME는 현실적이고 다양한, 최소한의 변형을 가진 반대설명 이미지를 생성하며, CelebA 데이터셋에서 여섯 가지 지표 중 다섯 가지에서 기존 최고 성능 기법을 능가한다. 또한 잠재적인 상관관계 탐지 평가를 향상시키기 위해 새로운 지표인 상관관계 차이(Correlation Difference)를 도입한다.
Counterfactual explanations have shown promising results as a post-hoc framework to make image classifiers more explainable. In this paper, we propose DiME, a method allowing the generation of counterfactual images using the recent diffusion models. By leveraging the guided generative diffusion process, our proposed methodology shows how to use the gradients of the target classifier to generate counterfactual explanations of input instances. Further, we analyze current approaches to evaluate spurious correlations and extend the evaluation measurements by proposing a new metric: Correlation Difference. Our experimental validations show that the proposed algorithm surpasses previous State-of-the-Art results on 5 out of 6 metrics on CelebA.
연구 동기 및 목표
- 이미지 분류기 결정에 대해 현실적이고 최소한의, 다양한 변형을 생성하는 사후 반대설명 방법을 개발하는 것.
- 확산 모델의 고유한 특성(예: 확률적 성격, 다중 수준의 잠재 공간)을 활용해 의미 있는 반대설명 편집을 생성하는 것.
- 기존 평가 지표의 한계를 보완하기 위해, 반대설명에서 미세한 잠재적 상관관계를 보다 잘 탐지할 수 있도록 새로운 지표인 상관관계 차이를 도입하는 것.
- 조건부 미세조정 없이도 무조건적 확산 모델을 효과적으로 반대설명에 재사용할 수 있음을 보여주는 것.
제안 방법
- DiME는 사전 훈련된 무조건적 노이즈 제거 확산 확률 모델(DDPM)을 활용하여, 목표 분류기의 기울기를 사용해 역노이즈 과정을 안내함으로써 반대설명 이미지를 생성한다.
- 이 방법은 다양한 노이즈 제거 단계에서 분류기 기울기를 확산 모델의 잠재 공간에 적용하여, 모델 예측을 변화시키면서도 이미지 구조를 유지하는 의미 있는 편집을 가능하게 한다.
- 이미지의 사실성 향상을 위해 인지적 손실 성분을 통합하여 생성된 반대설명이 현실적이며 인지적으로 타당한지 보장한다.
- 반대설명 데이터에 대해 확산 모델을 재학습하거나 조건화하지 않고, 단일 사전 훈련된 모델에서 기울기 기반 샘플링에 의존한다.
- 표준 지표(FID, FVA, MNAC)와 새로운 지표인 상관관계 차이를 사용하여 이미지 품질과 잠재적 상관관계 탐지 능력을 평가한다.
- 노이즈 수준 초기화 및 손실 가중치의 영향을 분석하기 위해 추론 실험(ablation study)를 실시하여 생성 파이프라인의 설계 선택 사항을 검증한다.

실험 결과
연구 질문
- RQ1사전 훈련된 확산 모델을 미세조정 없이 효과적으로 반대설명 생성에 재사용할 수 있는가?
- RQ2분류기 기울기를 사용한 지도 기반 확산 과정이 기존의 조건부 생성 또는 적대적 방법에 비해 반대설명의 품질과 다양성 측면에서 어떻게 비교되는가?
- RQ3기존의 FID 및 MNAC 같은 평가 지표가 반대설명이 잠재적 상관관계를 탐지하는 능력을 얼마나 정확히 반영하는가?
- RQ4새로운 지표인 상관관계 차이가 기존 방법보다 반대설명에서 미세한 잠재적 상관관계를 더 잘 포착할 수 있는가?
주요 결과
- DiME는 CelebA 데이터셋에서 여섯 가지 지표 중 다섯 가지에서 최고 성능을 기록하며, '미소(Smile)' 속성에 대해 FID, FVA, MNAC에서, '젊음(Young)' 속성에 대해 FID와 MNAC에서 기존 방법을 능가한다.
- 제안된 상관관계 차이 지표는 기존 지표인 MNAC가 반대설명에서 미세한 잠재적 상관관계를 탐지하지 못할 수 있음을 드러내며, 잘못된 정확성의 오해를 줄 수 있음을 시사한다.
- 추론 실험 결과, DiME의 원본 버전은 단순 및 직접 기울기 기반 기준 모델보다 사실성과 충실도 측면에서 뚜렷이 뛰어나며, 지도 기반 확산 과정에서 제안된 개선 사항의 중요성을 입증한다.
- 높은 계산 비용(각 반대설명에 약 1800회의 전방향 계산 필요)에도 불구하고 DiME는 다양한 의미 있는 편집(예: 표정 변화, 나이 외형 변화)을 생성하면서도 구조적 일관성을 유지한다.
- 정성적 결과는 DiME가 미소나 나이 변화와 같은 인지적으로 명확한 변화를 생성하지만, 원래의 정체성과 구조를 유지함을 보여주며, 손이나 목걸이와 같은 분포 외 요소에도 적용 가능하다.
- 무조건적 FID는 DiME의 결과보다 높게 나타나, 인지적 손실과 지도 기반 생성이 무조건적 샘플링을 초월해 이미지 품질을 향상시킨다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.