[논문 리뷰] Explaining Image Classifiers Using Contrastive Counterfactuals in Generative Latent Spaces
이 논문은 재학습하거나 조건화 없이, 사전 학습된 생성 모델의 잠재 공간을 활용하여 블랙박스 이미지 분류기에 대해 대조적이고 인과적이며 해석 가능한 역행적 설명을 생성하는 방법을 제안한다. 이를 통해 특성에 대한 충분성 및 필수성 점수를 통해 전역적 설명을 가능하게 하며, 얼굴 미모도 분류 작업에서 특성 기여도와 생성된 역행적 이미지를 통해 효과성을 입증한다.
Despite their high accuracies, modern complex image classifiers cannot be trusted for sensitive tasks due to their unknown decision-making process and potential biases. Counterfactual explanations are very effective in providing transparency for these black-box algorithms. Nevertheless, generating counterfactuals that can have a consistent impact on classifier outputs and yet expose interpretable feature changes is a very challenging task. We introduce a novel method to generate causal and yet interpretable counterfactual explanations for image classifiers using pretrained generative models without any re-training or conditioning. The generative models in this technique are not bound to be trained on the same data as the target classifier. We use this framework to obtain contrastive and causal sufficiency and necessity scores as global explanations for black-box classifiers. On the task of face attribute classification, we show how different attributes influence the classifier output by providing both causal and contrastive feature attributions, and the corresponding counterfactual images.
연구 동기 및 목표
- 특히 민감한 응용 분야에서 블랙박스 이미지 분류기에 대한 인과적이고 해석 가능한 설명의 부족을 해결하기 위해.
- 특성 변경이 분류기 결정에 인과적으로 영향을 주되, 인간이 이해할 수 있는 특성 변화를 유지하는 역행적 이미지를 생성하기 위해.
- 분류기 행동에 대한 전역적이고 대조적인 설명을 위해 확률적 충분성 및 필수성 점수를 계산하기 위해.
- 분류기의 학습 데이터에 종속되지 않고 사전 학습된 생성 모델을 사용하여 어떤 블랙박스 이미지 분류기든 설명할 수 있도록 하기 위해.
- 계수 기반 기여도 방법에 비해 안정성과 사전 처리 의존도 문제를 악용하지 않는 스케일러블하고 효율적인 대안을 제공하기 위해.
제안 방법
- 사전 학습된 생성 모델의 잠재 공간에서, 원하는 특성 변화를 예측하기 위해 이동 예측 모델을 훈련한다.
- 입력 이미지의 잠재 코드에 학습된 이동 방향을 적용하여 역행적 이미지를 생성하며, 정체성을 유지하면서 특정 특성을 수정한다.
- 특성 수정 시 결과 변화 가능성의 정도를 측정하여 결과 변화의 가능성을 기반으로 충분성 및 필수성 점수를 확률적으로 계산한다.
- 생성 모델의 잠재 공간(예: StyleGAN)에서 작동하여 생성기 재학습 없이도 효율적인 샘플링을 가능하게 한다.
- 양성 및 음성 특성 변화(예: 특성의 증가 또는 감소)를 지원하여 SUF⁺, SUF⁻, NEC⁺, NEC⁻ 점수를 계산한다.
- 대조적 추론에 기반한 설명: '이 특성이 다를 경우 어떻게 될까?'에 대해 결과 변화의 정량적 확률을 제공한다.
실험 결과
연구 질문
- RQ1어떻게 하면 블랙박스 분류기의 출력에 인과적으로 영향을 주면서도 해석 가능한 역행적 이미지를 생성할 수 있는가?
- RQ2사전 학습된 생성 모델은 어떻게 효율적이고 스케일러블하며 분리 가능한 역행적 생성을 가능하게 하는가?
- RQ3잠재 공간 조작을 통한 이미지 분류의 맥락에서 충분성 및 필수성 점수를 어떻게 정의하고 계산할 수 있는가?
- RQ4이러한 점수는 이미지 분류기 내 숨겨진 편향과 특성 간 상호작용을 어느 정도 드러내는가?
- RQ5확률적 역행적 설명에 기반한 대조적 설명은 기존 계수 기반 기여도 방법보다 우월한가?
주요 결과
- Heavy Makeup, Blond Hair, Young 특성에 대해 높은 SUF⁺ 값은 이 특성들을 증가시키는 것이 부 attractiveness 예측에서 attractiveness 예측으로 전환시키는 데 가장 충분함을 나타낸다.
- Male 및 Bald 특성에 대해 높은 SUF⁻ 값은 이 특성들을 감소시키는 것이 부 attractiveness 결과를 attractiveness로 뒤바꾸는 데 가장 충분함을 보여준다.
- Baldness, Moustache, Male 특성에 대해 높은 NEC⁺ 점수는 이러한 특성의 증가를 피하는 것이 attractiveness 분류를 유지하는 데 가장 필수적임을 나타낸다.
- Young, Heavy Makeup, Blond Hair 특성에 대해 높은 NEC⁻ 점수는 이러한 특성의 감소를 피하는 것이 attractiveness 레이블을 유지하는 데 가장 필수적임을 보여준다.
- 이 방법은 계산된 충분성 및 필수성 점수를 시각적으로 검증할 수 있는 현실적인 역행적 이미지를 성공적으로 생성한다.
- 사전 처리에 의존하지 않고 인과 기반의 안정적이고 해석 가능한 설명을 제공함으로써, 기존의 표준 계수 기반 기여도 방법보다 우수한 성능을 보인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.