Skip to main content
QUICK REVIEW

[논문 리뷰] SHAFF: Fast and consistent SHApley eFfect estimates via random Forests

Clément Bénard, Gérard Biau|arXiv (Cornell University)|2021. 05. 25.
Explainable Artificial Intelligence (XAI)참고 문헌 29인용 수 16
한 줄 요약

SHAFF는 랜덤 포레스트를 사용하여 Shapley 효과를 빠르고 일관되게 추정하는 방법으로, 재학습이 필요 없도록 중요도 샘플링과 투영된 포레스트를 활용한다. 종속 변수가 있는 경우에도 높은 정확도를 달성하며, 재학습 없이도 일관성 있는 것으로 입증된 첫 번째 방법이다.

ABSTRACT

Interpretability of learning algorithms is crucial for applications involving critical decisions, and variable importance is one of the main interpretation tools. Shapley effects are now widely used to interpret both tree ensembles and neural networks, as they can efficiently handle dependence and interactions in the data, as opposed to most other variable importance measures. However, estimating Shapley effects is a challenging task, because of the computational complexity and the conditional expectation estimates. Accordingly, existing Shapley algorithms have flaws: a costly running time, or a bias when input variables are dependent. Therefore, we introduce SHAFF, SHApley eFfects via random Forests, a fast and accurate Shapley effect estimate, even when input variables are dependent. We show SHAFF efficiency through both a theoretical analysis of its consistency, and the practical performance improvements over competitors with extensive experiments. An implementation of SHAFF in C++ and R is available online.

연구 동기 및 목표

  • 고차원 설정에서 정확한 Shapley 효과 추정의 계산 비용이 지수적 복잡도로 인해 비현실적이므로 이를 해결한다.
  • 입력 변수가 종속되어 있을 경우 기존 Shapley 추정 방법에서 발생하는 편향을 극복한다.
  • 랜덤 포레스트에 특화된 빠르고 일관되며 실용적인 Shapley 효과 추정 알고리즘을 개발한다.
  • 의료와 같은 고위험 응용 분야에서 해석 가능한 기계학습을 위한 정확한 변수 중요도 평가를 가능하게 한다.
  • 확장된 SHAP 값으로의 적용을 통해 전역 및 국소적 해석을 지원하는 프레임워크를 제공한다.

제안 방법

  • 랜덤 포레스트 경로를 따라 변수의 부분집합을 우선순위별로 샘플링하기 위해 중요도 샘플링을 사용하여 조건부 분산 추정의 수를 줄인다.
  • 모델을 재학습하지 않고도 어떤 변수 부분집합에 대한 조건부 기대값을 효율적으로 계산하기 위해 투영된 포레스트 알고리즘을 적용한다.
  • 랜덤 포레스트의 구조를 활용하여 단일 포레스트 학습으로 모든 부분집합 $U$에 대해 $\mathbb{V}[\mathbb{E}[Y|\mathbf{X}^{(U)}]]$를 추정한다.
  • 모든 부분집합에 대한 편향 없는 평균화를 보장하기 위해 조합적 가중치 $\frac{1}{p} \binom{p-1}{|U|}^{-1}$ 를 추정에 통합한다.
  • 약한 정규성 조건 하에서 추정기의 일관성을 증명하여, 모델 재학습 없이도 이론적 보장을 확립한다.
  • ranger에 구현된 조건부 평균 기반 순서화된 카테고리 분할 방식을 활용하여 순서형 변수에 대한 확장을 수행한다.

실험 결과

연구 질문

  • RQ1랜덤 포레스트를 사용하여 종속된 입력 변수가 있는 경우에도 빠르고 일관된 Shapley 효과 추정이 가능할 수 있는가?
  • RQ2Shapley 추정에서 모델을 반복 재학습하지 않도록 하는 것이 정확도와 일관성을 유지하는가?
  • RQ3오차와 런타임 측면에서 SHAFF는 TreeSHAP, SAGE, pMC와 같은 최첨단 방법들과 비교해 어떻게 성능을 내는가?
  • RQ4많은 카테고리 수를 가진 순서형 변수에 대해 MDI가 편향을 보이는 상황에서 SHAFF는 Shapley 효과를 정확하게 추정할 수 있는가?
  • RQ5투영된 포레스트 접근법이 모든 변수 부분집합에 대해 빠르고 정확한 조건부 기대값 추정을 가능하게 하는 데 충분한가?

주요 결과

  • pMC/Forest 실험에서 SHAFF는 누적 절대 오차가 0.19로 모든 방법 중에서 가장 낮게 기록되었으며, TreeSHAP와 SAGE를 능가했다.
  • 순서형 변수 실험에서 SHAFF는 $X^{(5)}$와 $X^{(6)}$에 대해 Shapley 효과가 0임을 정확히 추정했고, MDI와 SAGE는 고카디널리티 변수 쪽으로 강한 편향을 보였다.
  • pMC/Projected-RF 실험에서 SHAFF는 저오차(0.29)를 유지하여 조건부 기대값 추정의 강건성을 입증했다.
  • 경쟁 방법들보다 훨씬 빠른 속도를 기록했으며, 단일 포레스트 학습만으로도 가능했고, 다수의 재학습 단계가 필요한 방법들과는 대비된다.
  • SHAFF는 약한 가정 하에 모델을 여러 번 재학습하지 않아도 일관성이 입증된 첫 번째 Shapley 추정 방법이다.
  • 투영된 포레스트를 통한 조건부 예측 가능성이 있어, SHAP 값으로의 자연스러운 확장이 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.