Skip to main content
QUICK REVIEW

[논문 리뷰] A Human-Grounded Evaluation of SHAP for Alert Processing

Hilde Weerts, Werner van Ipenburg|arXiv (Cornell University)|2019. 07. 07.
Explainable Artificial Intelligence (XAI)참고 문헌 16인용 수 20
한 줄 요약

이 연구는 159명의 참가자가 경고 처리 작업을 수행하는 인간 기반 실험을 통해 SHAP 설명의 효과를 평가한다. 작업 성과에 유의미한 향상이 없음에도 불구하고, SHAP 값은 주목할 만한 특징에 주의를 환기시켜 의사결정에 영향을 주었다. 이는 SHAP의 유용성이 정확도 향상 외에도 주의 유도 기능에 있음을 시사한다.

ABSTRACT

In the past years, many new explanation methods have been proposed to achieve interpretability of machine learning predictions. However, the utility of these methods in practical applications has not been researched extensively. In this paper we present the results of a human-grounded evaluation of SHAP, an explanation method that has been well-received in the XAI and related communities. In particular, we study whether this local model-agnostic explanation method can be useful for real human domain experts to assess the correctness of positive predictions, i.e. alerts generated by a classifier. We performed experimentation with three different groups of participants (159 in total), who had basic knowledge of explainable machine learning. We performed a qualitative analysis of recorded reflections of experiment participants performing alert processing with and without SHAP information. The results suggest that the SHAP explanations do impact the decision-making process, although the model's confidence score remains to be a leading source of evidence. We statistically test whether there is a significant difference in task utility metrics between tasks for which an explanation was available and tasks in which it was not provided. As opposed to common intuitions, we did not find a significant difference in alert processing performance when a SHAP explanation is available compared to when it is not.

연구 동기 및 목표

  • SHAP 설명의 실제 의사결정 작업에서의 실용적 유용성을 평가하기 위해.
  • SHAP이 경고 처리 작업에서의 효율성, 효율성, 정신적 부담도에 영향을 미치는지 평가하기 위해.
  • written reflection 분석을 통해 SHAP가 인간의 추론 과정에 어떻게 영향을 미치는지 조사하기 위해.
  • SHAP 설명이 모델 신뢰도 점수만 제공하는 것과 비교해 성과에 측정 가능한 차이를 유도하는지 확인하기 위해.

제안 방법

  • 159명의 참가자가 학생 성취도 데이터셋을 사용해 단순화된 경고 처리 작업을 수행하는 두 가지 통제 실험을 실시했다.
  • 참가자들은 SHAP 설명 유무에 따라 예측을 참 또는 거짓 양성으로 평가했으며, 조건을 번갈아가며 수행했다.
  • 표준화된 지표와 사후 설문지를 통해 작업 효율성, 효율성, 정신적 부담을 측정했다.
  • NLP 기법을 활용해 SHAP 조건과 NoSHAP 조건 간 특징 언급 빈도를 비교하여 서면 추론를 분석했다.
  • t-검정, ANOVA 등의 통계적 검정을 통해 조건 간 성과를 비교하고, 사후 등가성 검정을 통해 유의미한 차이가 없는지를 평가했다.
  • 특정 용어 비율 차이가 0.2%p 이상인 경우를 기준으로 SHAP 값이 특징 언급 빈도를 증가시킨 사례를 식별했다.

실험 결과

연구 질문

  • RQ1SHAP 설명을 제공할 경우, 신뢰도 점수만 제공하는 것과 비교해 경고 처리 작업의 효율성에 유의미한 향상이 있는가?
  • RQ2SHAP 설명의 가용성이 인간 의사결정 과정에서 작업 효율성과 정신적 부담에 어떤 영향을 미치는가?
  • RQ3SHAP 설명은 도메인 전문가의 경고 평가 과정에서 추론 과정에 어느 정도 영향을 미치는가?
  • RQ4특정 특징이나 사례에서는 SHAP 설명이 더 일관되거나 정확한 추론을 이끌어내는가?

주요 결과

  • SHAP 설명이 있는 경우와 없는 경우 사이에서 작업 효율성, 효율성, 정신적 부담도에 통계적으로 유의미한 차이가 없었다.
  • 참가자들은 주로 모델의 신뢰도 점수를 주요 근거로 삼았으며, 이는 오해의 소지가 있을 수 있다.
  • 큰 절대값의 SHAP 값(0.07에서 0.11 사이)은 서면 추론에서 특정 특징 값에 대한 주의 증가와 관련이 있었다.
  • 14개 사례 중 5개에서 SHAP 조건에서 특징 값에 대한 언급 비율이 더 높게 나타나, 추론에 측정 가능한 영향을 미친 것으로 나타났다.
  • 귀무가설을 기각하지 못한 것은 데이터 부족 때문이 아니라 작은 효과 크기 때문이었으며, 이는 SHAP가 독립적으로는 제한된 유용성을 가짐을 시사한다.
  • SHAP 설명은 참가자들이 이전에 고려했던 특징 값을 버리게 하지는 않았지만, 이전에 간과했던 특징을 강조했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.