Skip to main content
QUICK REVIEW

[논문 리뷰] High Dimensional Model Explanations: an Axiomatic Approach

Neel Patel, Martin Strobel|arXiv (Cornell University)|2020. 06. 16.
Explainable Artificial Intelligence (XAI)참고 문헌 43인용 수 5
한 줄 요약

이 논문은 높은 차원의 모델 설명을 위한 새로운 축약적 프레임워크를 제안하며, Banzhaf 상호작용 지수(BII)를 사용해 고차원 상호작용을 포착한다. 대칭성, 단조성, 효율성과 같은 바람직한 성질를 공식화함으로써 저자들은 BII가 이러한 공리들을 만족하는 유일한 설명 방법임을 증명하고, 이가 블랙박스 모델의 최적 k차 다항식 근사와 일치함을 보이며, 특성별로 하나씩 분석하는 기존 방법보다 상호작용 효과를 더 잘 포착함을 보여준다.

ABSTRACT

Complex black-box machine learning models are regularly used in critical decision-making domains. This has given rise to several calls for algorithmic explainability. Many explanation algorithms proposed in literature assign importance to each feature individually. However, such explanations fail to capture the joint effects of sets of features. Indeed, few works so far formally analyze high-dimensional model explanations. In this paper, we propose a novel high dimension model explanation method that captures the joint effect of feature subsets. We propose a new axiomatization for a generalization of the Banzhaf index; our method can also be thought of as an approximation of a black-box model by a higher-order polynomial. In other words, this work justifies the use of the generalized Banzhaf index as a model explanation by showing that it uniquely satisfies a set of natural desiderata and that it is the optimal local approximation of a black-box model. Our empirical evaluation of our measure highlights how it manages to capture desirable behavior, whereas other measures that do not satisfy our axioms behave in an unpredictable manner.

연구 동기 및 목표

  • 복잡한 머신러닝 모델에서 고차원 상호작용을 포착하지 못하는 기존 특성별로 하나씩 분석하는 설명 방법의 한계를 해결하기 위해.
  • 기계학습 맥락에서 고차원 모델 설명을 위한 자연스럽고 바람직한 공리 집합을 체계화하기 위해.
  • Banzhaf 상호작용 지수(BII)가 이러한 공리들을 만족하는 유일한 설명 방법임을 증명하기 위해.
  • BII와 블랙박스 모델의 최적 다항식 근사 간의 연결 고리를 설정하여 기하학적이고 최적화 기반의 근거를 제공하기 위해.
  • 표준 방법이 실패하는 상황에서 BII가 의미 있는 특성 간 상호작용을 포착함을 실증적으로 보여주기 위해.

제안 방법

  • 대칭성, 극한 조건, 일반-2-효율성, 그리고 새로 제안된 단조성 공리 4개의 핵심 공리를 사용해 고차원 설명 방법을 축약화한다.
  • Banzhaf 상호작용 지수(BII)를 이러한 공리를 만족하는 유일한 해로 정의함으로써 특성 간 상호작용 효과의 충실한 표현을 보장한다.
  • 블랙박스 모델 f(·)를 2^N 내의 모든 입력 조합에 대해 전역 제곱 오차를 최소화하는 k차 다항식 g_k(·)로 근사하는 문제를 수립한다.
  • 최적의 k차 다항식 근사에서 단항식 ∏_{i∈S} x_i 의 계수는 특성 집합 S에 대한 BII 값과 정확히 일치함을 증명한다 (정리 2).
  • 최소 제곱 다항식 근사를 기하학적이고 통계적 기초로 삼아 BII를 통계학 및 게임 이론에서의 전통적 상호작용 개념과 연결한다.
  • 기존의 국소 선형 근사 기반 특성 기반 설명을 고차 다항식 근사로 확장하여 상호작용 효과를 포착한다.

실험 결과

연구 질문

  • RQ1특성 간 상호작용을 충실하게 포착하는 고차원 모델 설명을 고유하게 특징짓는 공리 집합은 무엇인가?
  • RQ2Banzhaf 상호작용 지수를 기계학습에서 모델 설명 방법으로 사용하는 데 있어 공식적인 근거는 무엇인가?
  • RQ3Banzhaf 상호작용 지수를 도출하는 자연스러운 최적화 문제는 무엇인가?
  • RQ4BII 기반 설명은 실제 모델에서 상호작용 효과를 포착하는 데 있어 표준 특성별로 하나씩 분석하는 방법보다 어떻게 다를까?
  • RQ5단조성과 같은 핵심 공리를 위반할 경우 설명 방법에 어떤 결과가 초래되는가?

주요 결과

  • Banzhaf 상호작용 지수(BII)는 새로 제안된 단조성 조건을 포함한 제안된 공리 집합을 유일하게 만족하는 설명 방법이다.
  • BII는 블랙박스 모델의 최소 제곱 다항식 근사에서 k차 항의 계수와 정확히 일치하며, 이는 기하학적이고 최적화 기반의 근거를 제공한다.
  • 실증 평가 결과, 표준 특성별로 하나씩 분석하는 설명 방법은 'not'과 'bad'가 함께 존재할 때 발생하는 긍정적 감정과 같은 상호작용 효과를 포착하지 못함을 보여주었다.
  • 단조성 공리를 위반하는 설명 방법은 예측 불가능하고 직관에 어긋나는 행동을 보이며, 예를 들어 'bad'와 'not'이 개별적으로는 높은 부정적 영향을 가짐에도 불구하고 함께 존재할 경우 긍정적 효과를 낼 수 있음에도 불구하고 그러한 영향을 제대로 반영하지 못한다.
  • BII 기반 방법은 특히 강한 상호작용 효과가 있는 경우에 특성 부분집합의 진정된 공동 영향을 포착함으로써 더 신뢰할 수 있고 해석 가능한 설명을 제공한다.
  • 이론적 분석을 통해 BII가 k차 다항식 근사를 통해 블랙박스 모델을 근사할 때 전역 제곱 오차를 최소화하는 데 최적임을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.