Skip to main content
QUICK REVIEW

[논문 리뷰] Counterfactual Generation and Fairness Evaluation Using Adversarially Learned Inference

Saloni Dash, Amit Sharma|arXiv (Cornell University)|2020. 09. 17.
Explainable Artificial Intelligence (XAI)참고 문헌 24인용 수 5
한 줄 요약

이 논문은 지식이 있는 인과 관계 그래프를 통합하여 의미 있는 이미지 변형을 생성하는 조건부 적대적 학습 추론(c-ALI) 프레임워크를 사용한 인과 인지 기반의 반사적 예측 생성 방법을 제안한다. 이는 Morpho-MNIST와 CelebA에서 타깃 속성과 그 인과적 후손을 변경하면서도 다른 특징을 유지함으로써 얼굴 매력도 분류기에서의 강건한 정당성 평가를 가능하게 한다.

ABSTRACT

Recent studies have reported biases in machine learning image classifiers, especially against particular demographic groups. Counterfactual examples for an input---perturbations that change specific features but not others---have been shown to be useful for evaluating explainability and fairness of machine learning models. However, generating counterfactual examples for images is non-trivial due to the underlying causal structure governing the various features of an image. To be meaningful, generated perturbations need to satisfy constraints implied by the causal model. We present a method for generating counterfactuals by incorporating a known causal graph structure in a conditional variant of Adversarially Learned Inference (ALI). The proposed approach learns causal relationships between the specified attributes of an image and generates counterfactuals in accordance with these relationships. On Morpho-MNIST and CelebA datasets, the method generates counterfactuals that can change specified attributes and their causal descendants while keeping other attributes constant. As an application, we apply the generated counterfactuals from CelebA images to evaluate fairness biases in a classifier that predicts attractiveness of a face.

연구 동기 및 목표

  • 이미지 분류기에서 속성 간 잠재적인 인과 관계를 존중하는 의미 있는 반사적 예측 예제를 생성하는 데 도전하는 것.
  • 실제로 인과적으로 일관된 속성 변화를 반영하는 반사적 예측을 생성하여 정당성 평가를 향상시키는 것.
  • 지정된 기능과 그 인과적 후손을 수정하면서도 비타겟 속성을 유지하는 방법을 개발하는 것.
  • 생성된 반사적 예측을 활용하여 훈련된 얼굴 매력도 분류기에서 정당성 편향을 탐지하고 정량화하는 것.

제안 방법

  • 이 방법은 지식이 있는 인과 관계 그래프 구조를 통합하여 반사적 예측 생성를 지도하는 조건부 변형된 Adversarially Learned Inference(이하 c-ALI)로 ALI를 확장한다.
  • 조건부 생성자와 판별자를 사용하여 인과 관계 그래프의 제약 조건 하에 이미지 속성의 결합 분포를 모델링한다.
  • 생성자는 특정 속성을 변형하면서도 그 인과적 의존성을 존중하고 관련 없는 특징을 유지함으로써 반사적 이미지를 학습한다.
  • 학습 중에 인과 관계 그래프의 구조적 제약 조건을 강제 적용하여, 변경 사항이 조작된 속성의 인과적 후손으로만 전파되도록 보장한다.
  • 반사적 학습을 사용하여 종단 간으로 모델을 훈련하며, 판별자는 실제 이미지와 생성된 반사적 이미지 간을 구분한다.
  • 이 방법은 Morpho-MNIST와 CelebA에서 평가되었으며, 타깃 속성과 그 인과적 후손을 변경하면서도 다른 속성을 일정하게 유지하는 반사적 예측을 생성한다.

실험 결과

연구 질문

  • RQ1기존의 인과 관계 그래프를 생성 과정에 통합함으로써 이미지 데이터에서 인과적으로 일관된 반사적 예측 생성이 가능한가?
  • RQ2지정된 속성과 그 인과적 후손을 수정하면서도 비타겟 속성을 얼마나 잘 유지할 수 있는가?
  • RQ3생성된 반사적 예측이 훈련된 이미지 분류기에서 정당성 편향을 어느 정도 탐지할 수 있는가?
  • RQ4인과적 구조를 통합함으로써 비인과적 기준 대비 생성된 반사적 예측의 의미적 타당성과 타당성이 향상되는가?

주요 결과

  • 제안된 방법은 Morpho-MNIST와 CelebA에서 특정 속성과 그 인과적 후손을 변경하면서도 다른 속성을 그대로 유지하는 반사적 이미지를 성공적으로 생성하였다.
  • 반사적 예측은 이미지 속성의 잠재적 인과적 구조를 존중하므로 의미적으로 타당하다.
  • CelebA에서 생성된 반사적 예측은 얼굴 매력도 분류기에서 심각한 정당성 편향을 드러내었으며, 특히 인구 통계적 속성이 예측에 영향을 미치는 방식에서 두드러졌다.
  • 비인과적 기준 대비 인과적 관계를 충실하게 반영하면서도 현실적인 반사적 예측을 생성하는 데서 본 방법이 승리하였다.
  • 반사적 예측 생성 과정에서 비타겟 특징을 잘 유지하는 것으로 확인되어, 특정 속성 변화를 고립하는 데에 강건함을 입증하였다.
  • 반사적 예측을 활용한 평가를 통해 다양한 인구 집단 간 매력도 예측의 격차를 드러내는 실질적인 통찰을 제공하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.