Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Ground Truth Explainability on Tabular Data

Brian Barr, Ke Xu|arXiv (Cornell University)|2020. 07. 20.
Explainable Artificial Intelligence (XAI)참고 문헌 23인용 수 5
한 줄 요약

이 논문은 XAI에서 참값 해석 가능성(ground truth explainability)을 가능하게 하기 위해 코풀라와 기호 표현을 사용한 합성 표본 데이터 생성 방법을 제안한다. 특징 간 상관관계와 기능적 종속성을 제어함으로써, 국소적이고 전역적인 검증 가능한 설명을 제공하며, 정보성 특징의 상관관계가 데이터 분포 편향으로 인해 SHAP 값에 왜곡을 초래함을 입증한다. 이는 모델 학습의 결과가 아니며, 데이터 분포의 영향이다.

ABSTRACT

In data science, there is a long history of using synthetic data for method development, feature selection and feature engineering. Our current interest in synthetic data comes from recent work in explainability. Today's datasets are typically larger and more complex - requiring less interpretable models. In the setting of extit{post hoc} explainability, there is no ground truth for explanations. Inspired by recent work in explaining image classifiers that does provide ground truth, we propose a similar solution for tabular data. Using copulas, a concise specification of the desired statistical properties of a dataset, users can build intuition around explainability using controlled data sets and experimentation. The current capabilities are demonstrated on three use cases: one dimensional logistic regression, impact of correlation from informative features, impact of correlation from redundant variables.

연구 동기 및 목표

  • 표본 데이터에 대한 사후 모델 설명 가능성에서 참값의 부재 문제를 해결하기 위해.
  • 특징 상관관계가 국소적 및 전역적 설명에 미치는 영향을 제어 가능한 실험으로 분석하기 위해.
  • 알려진 기능적 종속성과 통계적 성질을 갖춘 합성 데이터셋을 유연하고 재현 가능한 프레임워크로 생성하기 위해.
  • 정보성 특징과 부속적 특징 간 상관관계가 SHAP 기반 할당에 미치는 영향을 조사하기 위해.
  • 기호 전역 설명과 모델 독립적 국소 설명 간 격차를 합성 데이터를 통해 메우기 위해.

제안 방법

  • 코풀라를 사용하여 입력 특징의 균일 분포와 상관관계 구조를 정의함으로써 통계적 성질에 정밀한 제어를 가능하게 한다.
  • 기호 표현을 통해 특징과 타깃 레이블 간 진정한 기능적 관계를 정의함으로써 전역 해석 가능성 확보.
  • 기호 표현에서 유도된 확률 필드에 임계값을 적용하여 이진 분류 레이블을 할당한다.
  • 특징 중요도에 대한 알려진 참값을 갖는 데이터셋을 생성함으로써, SHAP와 같은 국소 설명 방법의 검증이 가능해진다.
  • 입력 상관관계가 설명 출력에 미치는 영향을 분리하기 위해 동일한 데이터의 상관관계 있는 버전과 없는 버전을 생성한다.
  • SHAP DeepExplainer를 사용하여 국소 할당을 계산하고, 다양한 데이터셋 간 비교를 통해 설명의 정확도를 평가한다.

실험 결과

연구 질문

  • RQ1정보성 특징 간 상관관계가 SHAP 값과 같은 국소 모델 설명의 신뢰성에 어떻게 영향을 미치는가?
  • RQ2부속적 특징(상관관계는 있으나 중요하지 않은 특징)이 존재할 경우, 이는 특징 중요도를 연역적으로 왜곡하여 국소 할당에 영향을 미치는가?
  • RQ3기능적 종속성이 알려진 합성 데이터는 표본 데이터에서 XAI 방법 평가를 위한 참값 기준이 될 수 있는가?
  • RQ4관찰된 SHAP 값의 왜곡은 모델 학습이 아닌 데이터 분포 편향으로 인한 것인가?
  • RQ5기호 표현과 코풀라를 어떻게 조합하여 복잡하고 현실적인 합성 표본 데이터를 생성하고, 그 설명을 검증 가능한가?

주요 결과

  • 정보성 특징 간 상관관계는 SHAP 값에 왜곡을 초래하며, 상관관계가 있는 데이터 분포에서 클래스 불균형으로 인해 값들이 1사분면과 3사분면 쪽으로 이동한다.
  • SHAP 값에 대한 상관관계의 영향은 모델이 학습한 편향이 아니라, 상관관계가 있는 데이터에 대한 기대값의 특성에 기인한 결과로, 비상관관계 기반 데이터로 재학습한 설명기구를 통해 이를 입증하였다.
  • 기호 표현에 포함되지 않은 부속적 특징들 역시 SHAP 할당에 상당한 영향을 미치며, 개별 기여도의 합이 기준 설명과 일치하지 않는다.
  • 부속적, 정보성, 소음 특징의 SHAP 값들을 합산해도 원래의 전역 설명을 복원하지 못함으로써, 설명 방법이 특징 공간의 구성에 민감함을 보였다.
  • 기호 표현은 검증 가능한 전역 설명을 제공하지만, 상관관계가 있는 데이터에서 SHAP 값은 체계적인 편차를 보이며, 이는 국소 설명의 해석에 주의가 필요함을 시사한다.
  • 진짜 특징 중요도가 알려진 합성 데이터셋을 성공적으로 생성함으로써, 표본 데이터에서 XAI 기법의 제어된 평가가 가능해졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.