Skip to main content
QUICK REVIEW

[논문 리뷰] ECINN: Efficient Counterfactuals from Invertible Neural Networks

Frederik Hvilshøj, Alexandros Iosifidis|arXiv (Cornell University)|2021. 03. 25.
Explainable Artificial Intelligence (XAI)참고 문헌 40인용 수 10
한 줄 요약

ECINN는 역가능한 신경망(INN)을 한 번의 정방향 및 역방향 계산을 통해 반사적 이미지를 생성하는 새로운 방법으로, 잠재 표현을 닫힌 형태로 수정함으로써 효율적이고 현실적이며 최소한의 변형을 가능하게 한다. 기존 방법에 비해 특히 INN에서 기울기 기반 방법이 노이즈가 심한 결과를 낼 때, 더 일관되고 고해상도의 히트맵을 생성하는 데 뛰어나다.

ABSTRACT

Counterfactual examples identify how inputs can be altered to change the predicted class of a classifier, thus opening up the black-box nature of, e.g., deep neural networks. We propose a method, ECINN, that utilizes the generative capacities of invertible neural networks for image classification to generate counterfactual examples efficiently. In contrast to competing methods that sometimes need a thousand evaluations or more of the classifier, ECINN has a closed-form expression and generates a counterfactual in the time of only two evaluations. Arguably, the main challenge of generating counterfactual examples is to alter only input features that affect the predicted outcome, i.e., class-dependent features. Our experiments demonstrate how ECINN alters class-dependent image regions to change the perceptual and predicted class of the counterfactuals. Additionally, we extend ECINN to also produce heatmaps (ECINNh) for easy inspection of, e.g., pairwise class-dependent changes in the generated counterfactual examples. Experimentally, we find that ECINNh outperforms established methods that generate heatmap-based explanations.

연구 동기 및 목표

  • 기존 반사적 예측 생성 방법이 수백 또는 수천 번의 모델 쿼리를 요구하는 비효율성 문제를 해결하기 위해.
  • 이미지 분류에서 클래스에 따라 달라지는 특징만 변경하는 현실적이고 최소한의 행동 가능한 반사적 예측을 생성할 수 있도록 하기 위해.
  • 역가능한 신경망(INN)을 위한 고해상도이고 해석 가능한 히트맵을 생성하는 방법을 개발하여, 기울기 기반 설명 방법의 노이즈 문제를 해결하기 위해.
  • INN의 의미적으로 정리된 잠재 공간이 닫힌 형태의 반사적 수정을 가능하게 하여 한 번의 추론으로도 실현 가능함을 보여주기 위해.

제안 방법

  • ECINN는 사전 학습된 역가능한 신경망(INN)을 사용하여 입력 이미지를 클래스에 따라 달라지는 특징들이 의미적으로 정리된 잠재 공간으로 매핑한다.
  • 반사적 수정을 잠재 공간 내에서 닫힌 형태의 최적화 문제로 설정함으로써, 클래스 관련 특징에만 최소하고 의미 있는 변화를 보장한다.
  • 잠재 표현을 수정하여 모델의 예측을 목표 클래스로 옮긴 후, ECINN는 역방향 INN을 적용하여 수정된 잠재 벡터에서 반사적 이미지를 재구성한다.
  • 이 방법은 원본 이미지와 반사적 이미지의 차이를 분석하여 히트맵을 계산하는 ECINNh로 확장되며, 클래스에 따라 달라지는 특징 변화에 대한 시각적 통찰을 제공한다.
  • ECINN는 분류기의 평가를 단 두 번만 수행한다: 한 번의 정방향 계산과 한 번의 역방향 계산으로, 반복적 방법보다 훨씬 효율적이다.
  • ECINN는 INN의 역가능성과 분리된 표현을 활용하여 신뢰할 수 있고 현실적이며 다양한 반사적 예측을 보장한다.

실험 결과

연구 질문

  • RQ1수천 번의 모델 평가가 아닌 두 번의 모델 평가만으로도 반사적 예측을 효율적으로 생성할 수 있는가?
  • RQ2역가능한 신경망이 잠재 표현의 닫힌 형태 수정을 가능하게 하여 현실적이고 최소한의 반사적 예측을 생성할 수 있는가?
  • RQ3ECINN에서 유도된 히트맵이 기울기 기반 방법보다 INN에서 더 일관되고 신뢰할 수 있는 설명을 제공하는가?
  • RQ4왜 기울기 기반 설명 방법은 INN에서 노이즈가 심한 히트맵을 생성하는가? 그리고 ECINNh는 이를 완화할 수 있는가?
  • RQ5ECINN는 배경, 머리카락 색상 등 클래스에 독립적인 특징을 유지하면서도, 얼굴 표정, 메이크업 등 클래스에 따라 달라지는 특징들만 효과적으로 수정할 수 있는가?

주요 결과

  • ECINN는 단 두 번의 모델 평가만으로도 반사적 예측을 생성한다—반복적 방법이 수백 또는 수천 번의 쿼리를 요구하는 것에 비해 훨씬 빠르다.
  • 이 방법은 배경, 머리카락 색상, 전체 이미지 레이아웃을 유지하면서도, 얼굴 표정, 메이크업, 얼굴 구조 등 클래스에 따라 달라지는 특징들만 성공적으로 수정한다.
  • ECINNh는 Integrated Gradients, DeepLift, DeepLiftSHAP, GradSHAP에 비해 더 일관되고 의미 있는 히트맵을 생성하며, 특히 기울기 방법이 노이즈가 심한 INN에서 뛰어난 성능을 보인다.
  • 연구자들은 INN 레이어에 ReLU 활성화 함수가 없기 때문에 기울기 설명이 노이즈가 심해지는 것으로 추측하며, ECINNh는 입력과 반사적 이미지 간의 구조적 차이를 활용하여 이를 피한다.
  • ECINNh는 모델이 메이크업을 전반적으로 감지함을 확인한다(단지 입술만이 아니라), 즉 메이크업 레이블로 훈련된 모델이 고립된 특징이 아닌 얼굴 전체의 맥락을 사용한다는 것을 확인한다.
  • ECINNh의 히트맵은 인간의 인지와 강하게 일치한다. 예를 들어, 미소를 강조할 때 입술과 눈을 중심으로 강조되며, 립스틱과 농도 있는 메이크업처럼 관련된 레이블 간에 거의 동일한 패tern을 보여주어 모델 행동을 충실하게 반영함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.