Skip to main content
QUICK REVIEW

[논문 리뷰] Interpretable Data-Based Explanations for Fairness Debugging

Romila Pradhan, Jiongli Zhu|arXiv (Cornell University)|2021. 12. 17.
Explainable Artificial Intelligence (XAI)인용 수 4
한 줄 요약

Gopher는 모델 편향의 근본 원인을 특정 training data pattern으로 추적하고 해소할 수 있도록 돕는 새로운 프레임워크를 제안한다. 이는 편향을 유발하는 데이터 패턴을 인과적으로 책임지게 하여, 해당 패턴을 제거하거나 수정했을 때 편향을 가장 크게 줄일 수 있는 데이터 서브셋을 순위 매김함으로써 개발자가 훈련 데이터의 근본 원인에서 편향을 진단하고 완화할 수 있도록 한다.

ABSTRACT

A wide variety of fairness metrics and eXplainable Artificial Intelligence (XAI) approaches have been proposed in the literature to identify bias in machine learning models that are used in critical real-life contexts. However, merely reporting on a model's bias, or generating explanations using existing XAI techniques is insufficient to locate and eventually mitigate sources of bias. We introduce Gopher, a system that produces compact, interpretable and causal explanations for bias or unexpected model behavior by identifying coherent subsets of the training data that are root-causes for this behavior. Specifically, we introduce the concept of causal responsibility that quantifies the extent to which intervening on training data by removing or updating subsets of it can resolve the bias. Building on this concept, we develop an efficient approach for generating the top-k patterns that explain model bias that utilizes techniques from the machine learning (ML) community to approximate causal responsibility and uses pruning rules to manage the large search space for patterns. Our experimental evaluation demonstrates the effectiveness of Gopher in generating interpretable explanations for identifying and debugging sources of bias.

연구 동기 및 목표

  • 기존의 XAI 방법들이 훈련 데이터 원천으로의 편향 추적 기능이 부족한 점을 보완하기 위해.
  • 기대치 못한 또는 차별적인 모델 행동에 대해 설명 가능하고, 압축적이며 인과 기반인 설명을 생성하는 시스템을 개발하기 위해.
  • 특정 훈련 데이터 서브셋이 불공정한 결과를 유발하는 원인임을 식별함으로써, ML 전문가가 편향을 디버깅하고 완화할 수 있도록 하기 위해.
  • 편의성 디버깅에서 훈련 데이터 서브셋에 대한 인과적 책임 개념을 체계화하기 위해.
  • 모델 편향을 가장 크게 줄일 수 있는 상위-k 데이터 패턴을 식별하는 확장 가능한 방법을 제공하기 위해.

제안 방법

  • 모델 편향을 줄이기 위해 특정 훈련 데이터 서브셋을 제거하거나 수정했을 때의 영향을 측정하기 위해 인과적 책임을 정량화하는 개념을 도입한다.
  • 대규모 잠재적 데이터 패턴의 검색 공간을 효율적으로 다루기 위해 기계학습 기법과 프루닝 규칙을 활용해 인과적 책임을 근사화하는 효율적인 알고리즘을 개발한다.
  • 편향과 인과적으로 연결된 일관성 있고 해석 가능한 훈련 데이터 서브셋을 발견하기 위해 패턴 마이닝 기법을 사용한다.
  • 모델 편향을 설명하는 데 가장 영향력 있는 데이터 패턴을 선별하기 위해 상위-k 선택 전략을 적용한다.
  • 향후 효율성을 향상시키기 위해 데이터베이스 프로벤런스 및 머신 언러닝 기법을 통합하기 위한 잠재적 기반을 마련한다.
  • 정확도를 유지하면서 계산 비용을 줄이기 위해 프루닝 히우리스틱을 적용한다.

실험 결과

연구 질문

  • RQ1불공정한 모델 행동의 원인이 되는 훈련 데이터 패턴은 무엇인가?
  • RQ2상위-k 훈련 데이터 서브셋을 효율적으로 식별하여, 이들의 제거 또는 수정이 모델 편향을 가장 크게 줄일 수 있는가?
  • RQ3특정 훈련 데이터에 근거한, 해석 가능하고 압축적이며 인과 기반의 설명을 통해 편향의 근본 원인을 특정할 수 있는가?
  • RQ4인과 기반 설명과 상관 기반 또는 특성 기반 설명 간에 편향의 근본 원인을 규명하는 데에서 어떤 차이가 있는가?
  • RQ5이 프레임워크는 미분 불가능한 모델, 예를 들어 트리 기반 또는 클러스터링 알고리즘과 같은 모델로도 확장 가능한가?

주요 결과

  • Gopher는 '기혼이 아닌 여성이 주택 소유자인' 것처럼, 대출 예측에서 성별 편향의 근본 원인이 되는 해석 가능한 데이터 패턴을 성공적으로 식별한다.
  • 시스템은 인과적 책임 근사치를 효율적으로 계산하여 상위-k 책임 있는 데이터 서브셋을 확장 가능하게 탐색할 수 있다.
  • 실험적 평가 결과, Gopher의 설명은 지식 기반의 지표 편향이 잘 알려진 데이터셋에서 알려진 편향 원인을 정확히 식별함을 확인한다.
  • Gopher의 설명은 특성 기반 및 인스턴스 기반 XAI 방법보다 훈련 데이터의 편향 근본 원인 진단에서 뛰어난 성능을 보인다.
  • 이 프레임워크는 훈련 데이터의 데이터 불균형, 오분류, 측정 오류 등으로 인한 편향을 탐지하고 설명하는 데 효과적이다.
  • 이 방법은 일반화 가능하며, 미분 가능한 모델을 초월한 다양한 ML 모델을 지원하기 위해 확장 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.