[논문 리뷰] Challenging common interpretability assumptions in feature attribution explanations
이 논문은 기계학습에서 특성 기여도 설명에 관해 널리 공유되는 세 가지 가정을 도전한다: 더 단순한 모델이 더 해석 가능하다는 것, 모델에 종속되지 않는 설명이 보편적으로 효과적이라는 것, 그리고 어떤 설명이라도 의사결정을 향상시킨다는 것. 아마존 메카니컬 터크에서 실시한 대규모 인간 대상 실험을 통해 저자들은 특성 기여도 설명이 유의미한 이점을 제공하지 못하고, 오히려 인지적 및 맥락적 혼동 인자로 인해 의사결정을 손상시킬 수 있음을 발견하여, 인간이 개입하는 시스템에서 이러한 설명의 보편적 가치에 대한 가정을 뒤집었다.
As machine learning and algorithmic decision making systems are increasingly being leveraged in high-stakes human-in-the-loop settings, there is a pressing need to understand the rationale of their predictions. Researchers have responded to this need with explainable AI (XAI), but often proclaim interpretability axiomatically without evaluation. When these systems are evaluated, they are often tested through offline simulations with proxy metrics of interpretability (such as model complexity). We empirically evaluate the veracity of three common interpretability assumptions through a large scale human-subjects experiment with a simple "placebo explanation" control. We find that feature attribution explanations provide marginal utility in our task for a human decision maker and in certain cases result in worse decisions due to cognitive and contextual confounders. This result challenges the assumed universal benefit of applying these methods and we hope this work will underscore the importance of human evaluation in XAI research. Supplemental materials -- including anonymized data from the experiment, code to replicate the study, an interactive demo of the experiment, and the models used in the analysis -- can be found at: https://doi.pizza/challenging-xai.
연구 동기 및 목표
- 후행 특성 기여도 설명에서 널리 공유되는 세 가지 일반적인 해석 가능성 가정의 타당성을 실증적으로 평가하는 것.
- 실제 세계와 유사한 고위험 상황에서 특성 기여도 설명이 인간의 의사결정을 향상시키는지 평가하는 것.
- 다양한 데이터 희소성 수준과 사용자 집단에서 모델에 종속되지 않는 설명이 보편적으로 유익한지 조사하는 것.
- XAI 연구에서 해석 가능성의 대체 지표로 모델 복잡도를 사용하는 것의 문제를 도전하는 것.
- 프록시 기반 검증의 한계를 감안할 때, 인간 중심 평가의 중요성을 부각하는 것.
제안 방법
- 300명의 참가자가 참여한 아마존 메카니컬 터크에서 혼합된 간접/내부 측정 반복 실험을 실시하였다.
- 참가자들이 순위화된 특성 기여도를 바탕으로 두 모델을 비교하는 주택 가격 예측 과제를 사용하였다.
- 실제 설명의 효과를 분리하기 위해 위약 설명 조건을 도입하였다.
- 개인의 능력과 항목의 어려움 파rameter를 추정하기 위해 베이지안 계층 모델링을 적용하여 개인 및 데이터 인스턴스의 변동성을 포착하였다.
- LIME, SHAP, Ridge 및 위약 대조 조건을 포함한 네 가지 설명 방법을 두 가지 데이터 희소성 조건에서 평가하였다.
- 설명 유형, 특성 수, 데이터 희소성의 영향을 의사결정 정확도에 미치는 영향을 분석하기 위해 통계 모델링을 사용하였다.
실험 결과
연구 질문
- RQ1특성 기여도 설명을 제공함으로써 인간의 의사결정 정확도가 설명 없을 경우보다 향상되는가?
- RQ2인간이 개입하는 모델 선택 과정에서 위약 또는 설명 없음 대비 모델에 종속되지 않는 설명을 사용할 경우에 유의미한 이점이 있는가?
- RQ3데이터 희소성이 다양한 설명 방법이 인간 의사결정을 지원하는 데 미치는 영향에 어떻게 작용하는가?
- RQ4설명에 포함된 특성 수가 사용자가 더 나은 성능을 보이는 모델을 식별하는 능력에 영향을 미치는가?
- RQ5개인의 차이와 항목 수준의 변동성이 설명의 인식된 유용성에 얼마나 큰 영향을 미치는가?
주요 결과
- 특성 기여도 설명은 위약 대조 조건과 비교해 의사결정 정확도 향상이 거의 없었으며, 통계적으로 유의미한 이점이 없었다.
- 특히 희소 데이터셋에서, 특성 기여도 설명은 설명 없음보다 악화된 의사결정을 초래했으며, 이는 인지적 간섭의 가능성을 시사한다.
- 사용자가 더 나은 성능을 보이는 모델을 식별하는 능력에 특성 수의 영향은 유의미하지 않았다 (β = 0.02, 95% CI = [-0.03, 0.06]).
- 데이터 희소성에 따라 설명 방법의 효과가 반전되었는데, SHAP는 희소 데이터에서 Ridge를 능가했고, Ridge는 예상보다 열등한 성능을 보였다.
- 항목 수준의 어려움(쉬움) 파rameter는 개인 수준의 능력보다 더 높은 분산을 보였으며, 이는 설명 유용성에 강력한 항목 특화 혼동 요인이 존재함을 시사한다.
- 사용자 성능과 항목 어려움 모두 상당한 이질성이 있었으며, 이는 사용자와 데이터 인스턴스 전반에 걸쳐 해석 가능성의 균일성에 대한 가정을 도전한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.