Skip to main content
QUICK REVIEW

[논문 리뷰] An empirical study of the effect of background data size on the stability of SHapley Additive exPlanations (SHAP) for deep learning models

Han Yuan, Mingxuan Liu|arXiv (Cornell University)|2022. 04. 24.
Explainable Artificial Intelligence (XAI)인용 수 15
한 줄 요약

이 경험적 연구는 심층학습 모델에 대한 SHapley Additive 설명(Shapley Additive Explanations, SHAP)의 안정성에 배경 데이터 크기가 미치는 영향을 조사한다. MIMIC-III 데이터셋과 세 층의 인공신경망(ANN)을 사용하여, 저자들은 작은 배경 데이터셋을 사용할 경우 SHAP 값과 변수 순위가 크게 변동하지만, 표본 수가 증가함에 따라 안정화되며, 극단적(가장/가장 덜) 중요한 변수들에 유리한 U자형의 신뢰성 패턴을 보임을 입증한다. 더 큰 배경 데이터셋은 설명의 안정성을 향상시키며, 이는 신뢰할 수 있는 해석을 위해 사용자가 크기를 우선시해야 한다는 것을 시사한다.

ABSTRACT

Nowadays, the interpretation of why a machine learning (ML) model makes certain inferences is as crucial as the accuracy of such inferences. Some ML models like the decision tree possess inherent interpretability that can be directly comprehended by humans. Others like artificial neural networks (ANN), however, rely on external methods to uncover the deduction mechanism. SHapley Additive exPlanations (SHAP) is one of such external methods, which requires a background dataset when interpreting ANNs. Generally, a background dataset consists of instances randomly sampled from the training dataset. However, the sampling size and its effect on SHAP remain to be unexplored. In our empirical study on the MIMIC-III dataset, we show that the two core explanations - SHAP values and variable rankings fluctuate when using different background datasets acquired from random sampling, indicating that users cannot unquestioningly trust the one-shot interpretation from SHAP. Luckily, such fluctuation decreases with the increase of the background dataset size. Also, we notice an U-shape in the stability assessment of SHAP variable rankings, demonstrating that SHAP is more reliable in ranking the most and least important variables compared to moderately important ones. Overall, our results suggest that users should take into account how background data affects SHAP results, with improved SHAP stability as the background sample size increases.

연구 동기 및 목표

  • 심층학습 모델에 대한 SHAP 설명의 안정성에 배경 데이터셋 크기가 미치는 영향을 조사하기 위해.
  • 다양한 배경 표본 크기에서 SHAP 값과 변수 순위의 변동성을 정량화하기 위해.
  • 정확도(bleu)와 흐린 유사도(jaccard) 측정 기반의 SHAP 기반 변수 순위의 신뢰성을 평가하기 위해.
  • 안정적인 모델 해석을 위해 최적의 배경 데이터셋 크기를 선택하는 데 실용적 지침을 제공하기 위해.

제안 방법

  • MIMIC-III 데이터셋에서 추출한 다양한 크기(100에서 1000까지)의 무작위 배경 데이터셋을 사용하여 SHAP 설명을 경험적으로 평가하였다.
  • DeepExplainer를 통해 인스턴스 수준의 SHAP 값을 계산하였으며, 배경 데이터셋을 사용해 사전 기대값(P_bg)을 추정하였다.
  • 모든 인스턴스에 걸쳐 절대 SHAP 값의 합으로 모델 수준의 변수 중요도를 계산하였다.
  • 정확한 순서 비교를 위한 BLEU 점수와 흐린 집합 유사도를 위한 Jaccard 지수를 사용하여 변수 순위의 안정성을 평가하였다.
  • 표본 크기별로 100번의 독립 시뮬레이션을 수행하여 SHAP 값과 순위의 변동성을 정량화하기 위한 통계 분석을 실시하였다.
  • 표본 크기가 증가함에 따라 배경 분포의 수렴 현상을 설명하기 위해 중심극한정리의 논리를 적용하였다.

실험 결과

연구 질문

  • RQ1배경 데이터셋 크기가 심층학습 모델의 SHAP 값 안정성에 어떻게 영향을 미치는가?
  • RQ2다양한 크기의 배경 데이터셋을 사용할 경우, SHAP에서 유도된 변수 순위는 어느 정도 변동하는가?
  • RQ3SHAP 변수 순위의 신뢰성에 U자형 패턴이 존재하는가? 즉, 중간 정도로 중요한 변수보다 가장/가장 덜 중요한 변수에 대해 더 높은 안정성을 보이는가?
  • RQ4안정적이고 신뢰할 수 있는 SHAP 설명을 얻기 위해 최적의 배경 데이터셋 크기는 무엇인가?
  • RQ5사용자는 예산 제약 조건 내에서 계산 비용을 추정하고 대표적인 배경 데이터셋을 선택할 수 있는가?

주요 결과

  • 작은 배경 데이터셋(예: 100개 표본)을 사용할 경우 SHAP 값과 변수 순위에 뚜렷한 변동성이 나타나 안정성이 낮음을 시사한다.
  • 배경 데이터셋 크기가 증가함에 따라 SHAP 설명의 안정성이 향상되며, BLEU 점수와 Jaccard 점수가 100에서 1000 표본으로 갈수록 단조롭게 향상된다.
  • BLEU 점수와 Jaccard 점수에 나타나는 U자형 패턴은 SHAP가 가장 중요한 변수와 가장 덜 중요한 변수의 순위를 가장 안정적으로 제공하며, 중간 정도로 중요한 변수의 순위는 낮은 안정성을 보임을 나타낸다.
  • 1000개의 배경 표본을 사용할 경우 BLEU 점수는 0.818, Jaccard 지수는 평균 0.924에 도달하여 변수 순위의 높은 안정성을 보였다.
  • 본 연구는 전체 훈련 데이터셋을 배경 데이터셋으로 사용하는 것이 최적일 수 있음을 제안하지만, 이는 계산 비용이 표본 크기와 선형적으로 증가하기 때문이다.
  • 100개 표본을 사용한 프리리서치 실험을 통해 더 큰 데이터셋의 계산 비용을 추정할 수 있으며, 복잡도는 m/100 × C_100 비례로 선형적으로 증가한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.