Skip to main content
QUICK REVIEW

[논문 리뷰] Axiomatic Aggregations of Abductive Explanations

Gagan Biradar, Yacine Izza|arXiv (Cornell University)|2023. 09. 29.
Explainable Artificial Intelligence (XAI)Computer Science인용 수 3
한 줄 요약

이 논문은 다수의 추론적 설명을 강력한 특성 중요도 점수로 변환하는 3가지 축약적 집계 방법—책임 지수, Deegan-Packel 지수, Holler-Packel 지수—를 제안한다. 협동 게임 이론과 인과력 측도를 활용함으로써, 이 방법들은 고유한 바람직한 성질을 만족하며, LIME와 SHAP보다 적대적 공격 상황에서 모델 편향을 더 잘 식별한다.

ABSTRACT

The recent criticisms of the robustness of post hoc model approximation explanation methods (like LIME and SHAP) have led to the rise of model-precise abductive explanations. For each data point, abductive explanations provide a minimal subset of features that are sufficient to generate the outcome. While theoretically sound and rigorous, abductive explanations suffer from a major issue -- there can be several valid abductive explanations for the same data point. In such cases, providing a single abductive explanation can be insufficient; on the other hand, providing all valid abductive explanations can be incomprehensible due to their size. In this work, we solve this issue by aggregating the many possible abductive explanations into feature importance scores. We propose three aggregation methods: two based on power indices from cooperative game theory and a third based on a well-known measure of causal strength. We characterize these three methods axiomatically, showing that each of them uniquely satisfies a set of desirable properties. We also evaluate them on multiple datasets and show that these explanations are robust to the attacks that fool SHAP and LIME.

연구 동기 및 목표

  • 단일 예측에 대해 다수의 타당하지만 상충되는 최소 특성 집합을 생성할 수 있는 추론적 설명의 한계를 해결한다.
  • LIME와 SHAP와 같은 사후 설명 방법의 단점을 극복한다. 이러한 방법들은 조작에 취약하고 모델 구조를 정확히 반영하지 못한다.
  • 다수의 추론적 설명을 통합된 해석 가능한 특성 중요도 점수로 집계하는 원칙적이고 축약적인 프레임워크를 개발한다.
  • LIME와 SHAP 설명이 조작되는 적대적 공격에 대해 강건한 집계 방법을 확보함으로써, 민감한 특성의 영향을 탐지하는 데 특별히 유의미한 성능을 발휘한다.

제안 방법

  • 공식 인과 이론에서 유래한 인과력 측도인 책임도의 정도를 기반으로 한 책임 지수를 제안한다.
  • 협동 게임 이론에서 유도된 Deegan-Packel 지수와 Holler-Packel 지수를 도입하여 추론적 설명 집합 내 특성 중요도를 정량화한다.
  • 각 집계 방법을 축약적 특성화를 통해 수학적으로 정의하고, 바람직한 성질의 집합을 만족하는 유일성에 대해 증명한다.
  • 실세계 데이터셋(Compas 및 German Credit)을 대상으로, LIME와 SHAP와의 성능을 적대적 공격 상황에서 비교한다.
  • 각 데이터 포인트에 대한 추론적 설명을 계산하기 위해 SAT/SMT 또는 MILP 오라클을 사용한 후, 제안된 지수를 통해 집계한다.
  • 중요도 점수 기반으로 특성 순위를 매기고, 민감한 속성(예: 인종, 성별)이 상위 기여자로 올바르게 식별되는 빈도를 측정하여 강건성 평가를 수행한다.

실험 결과

연구 질문

  • RQ1추론적 설명을 체계적으로 특성 중요도 점수로 집계할 수 있는가? 이는 이론적 엄밀성과 설명 가능성의 향상을 보장하는가?
  • RQ2제안된 집계 방법이 고유하게 특정 바람직한 축약적 성질의 집합을 만족하는가? 이는 설명 생성의 공정성과 일관성 보장을 보장하는가?
  • RQ3LIME와 SHAP에 비해 적대적 공격 상황에서 모델 편향을 탐지하는 데에 제안된 방법이 얼마나 효과적인가?
  • RQ4민감한 특성이 조작되거나 결과와 상관관계를 가지는 경우, 집계 방법이 얼마나 강건하게 유지되는가?
  • RQ5이러한 축약적 프레임워크는 추론적 설명 외의 다른 설명 유형으로 일반화될 수 있는가?

주요 결과

  • 책임 지수, Deegan-Packel 지수, Holler-Packel 지수 각각이 고유하게 다른 축약적 성질의 집합을 만족함으로써 이론적 타당성과 해석 가능성을 확보한다.
  • Compas 데이터셋에서 LIME 공격 상황에서, 제안된 방법을 사용할 경우 민감한 특성 '인종'이 테스트 인스턴스의 84% 이상에서 상위 3위 이내로 순위 매겨졌지만, LIME는 두 개의 상관관계가 없는 특성이 존재할 경우 거의 0%의 비율로 순위가 매겨졌다.
  • 동일한 데이터셋에서 SHAP 공격 상황에서, 민감한 특성 '인종'이 제안된 지수를 사용할 경우 최소 86%의 경우에서 가장 중요한 특성으로 순위 매겨졌지만, SHAP는 41.6%에 그쳤다.
  • German Credit 데이터셋에서 민감한 특성 '성별'이 제안된 방법을 사용할 경우 87% 이상의 인스턴스에서 최상위 특성으로 정확히 식별되었지만, SHAP와 LIME는 어느 경우에도 높은 순위를 매기지 못했다.
  • LIME와 SHAP가 적대적 조작에 취약하여 실패하는 상황에서도, 제안된 방법은 모델이 편향되어 있을 경우 민감한 특성이 가장 중요한 특성으로 정확히 식별하는 데 성공했다.
  • LIME 및 SHAP 공격 시나리오 전반에서 제안된 방법은 모델 편향을 탐지하는 데 강건함을 입증했으며, 특히 모델의 결정이 민감한 속성에 의해 영향을 받는 경우에 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.