Skip to main content
QUICK REVIEW

[논문 리뷰] Impact of Accuracy on Model Interpretations

Brian Liu, Madeleine Udell|arXiv (Cornell University)|2020. 11. 17.
Explainable Artificial Intelligence (XAI)참고 문헌 14인용 수 10
한 줄 요약

이 논문은 기계학습 모델의 해석 품질을 정량화하기 위해 pMode와 WKT10이라는 두 가지 지표를 제안하고, 모델 정확도가 이러한 지표에 미치는 영향을 조사한다. 서브샘플링 및 부트스트랩 실험을 통해 고정확도 모델의 경우 단순한 방법, 예를 들어 계수 크기 순으로 정렬한 로지스틱 회귀와 같은 방법이 더 높은 품질의 해석을 제공하는 것으로 밝혀졌으며, 저정확도 모델의 경우 XGBoost에 SHAP를 결합한 방법이 가장 신뢰할 수 있고 안정적인 해석을 제공함을 확인하였다.

ABSTRACT

Model interpretations are often used in practice to extract real world insights from machine learning models. These interpretations have a wide range of applications; they can be presented as business recommendations or used to evaluate model bias. It is vital for a data scientist to choose trustworthy interpretations to drive real world impact. Doing so requires an understanding of how the accuracy of a model impacts the quality of standard interpretation tools. In this paper, we will explore how a model's predictive accuracy affects interpretation quality. We propose two metrics to quantify the quality of an interpretation and design an experiment to test how these metrics vary with model accuracy. We find that for datasets that can be modeled accurately by a variety of methods, simpler methods yield higher quality interpretations. We also identify which interpretation method works the best for lower levels of model accuracy.

연구 동기 및 목표

  • 예측 정확도가 모델 해석 방법의 기술적 정확도에 미치는 영향을 조사하는 것.
  • 진실성과 안정성 측면에서 해석 품질을 정량화하기 위한 두 가지 새로운 지표인 pMode와 WKT10을 개발하고 검증하는 것.
  • 다양한 수준의 모델 정확도에서 가장 신뢰할 수 있는 결과를 도출하는 해석 방법을 규명하는 것.
  • 데이터 과학자들이 모델 성능에 기반하여 해석 방법을 선택하는 데에 근거가 되는 권고안을 제공하는 것.
  • 서브샘플링 및 부트스트랩을 활용하여 정확도 변동에 대한 해석의 견고성 테스트의 중요성을 입증하는 것.

제안 방법

  • 기능 프록시를 기반으로 한 공식화된 상한을 활용하여 진정한 특성 순위를 복원할 확률을 측정하는 pMode를 제안한다.
  • 부트스트랩된 데이터셋 간의 특성 중요도 순위 일관성을 평가하여 해석의 안정성을 측정하는 WKT10을 정의한다.
  • 다양한 정확도 수준을 시뮬레이션하기 위해 여러 정확도 버킷에 걸쳐 모델 정확도를 인위적으로 감소시키기 위해 서브샘플링을 사용한다.
  • 선형 모델, SHAP를 사용한 트리 기반 모델, LIME, MDI를 포함한 다양한 해석 방법을 각 정확도 수준에 적용한다.
  • 각 방법-정확도 조합에 대해 pMode와 WKT10를 계산하여 실험 조건 전반에서 진실성과 안정성을 평가한다.
  • 부트스트랩 리샘플링을 사용하여 변동 간격을 추정하고 정확도 변화에 따른 해석의 견고성 평가를 수행한다.

실험 결과

연구 질문

  • RQ1모델의 예측 정확도는 특성 중요도 해석의 진실성과 안정성에 어떤 영향을 미치는가?
  • RQ2다양한 수준의 모델 정확도에서 어떤 해석 방법이 가장 높은 품질의 해석(진실성과 안정성 측면에서)을 제공하는가?
  • RQ3정확도가 낮을 때 기저 모델의 복잡성 또는 해석 알고리즘의 복잡성이 해석 품질에 영향을 미치는가?
  • RQ4SHAP와 LIME은 다양한 모델 정확도 수준에서 안정성과 진실성 측면에서 어떻게 비교되는가?
  • RQ5서브샘플링 및 부트스트랩은 정확도 변동에 대한 해석의 견고성을 효과적으로 평가하는 데에 사용될 수 있는가?

주요 결과

  • 높은 정확도로 모델링이 가능한 데이터셋에서는 XGBoost에 SHAP를 적용한 복잡한 모델보다도 계수 크기 순으로 정렬한 로지스틱 회귀(RCM)와 같은 단순한 해석 방법이 더 높은 품질의 해석을 제공한다.
  • 모델 정확도가 낮을 경우, XGBoost에 SHAP를 적용한 방법이 다양한 정확도 버킷에서 pMode와 WKT10 점수 측면에서 뛰어난 pMode와 WKT10 점수를 기록하여 가장 안정적이고 신뢰할 수 있는 해석을 제공한다.
  • XGBoost에 SHAP를 적용한 방법은 저정확도 및 중간정확도 버킷에서 단일 피크를 보이는 해석 안정성 분포를 보이며, 다른 방법들이 보이는 이중 피크 패턴과는 대조적으로 더 높은 견고성을 나타낸다.
  • SHAP는 국소적 특성 설명에서는 LIME보다, 전역적 특성 설명에서는 MDI보다 항상 뛰어난 성능을 보이며, 특히 경계 기여도의 평균화로 인한 더 높은 안정성 덕분이다.
  • 진실성과 안정성 측면에서 해석 품질은 모델 정확도가 높아질수록 향상되며, 이 경향은 전역 및 국소 설명 유형 전반에서 일관되게 관찰된다.
  • 오차 범위(예: 부트스트랩에서 유도된 오차 밴드)를 사용하면 데이터 과학자들이 정확도 변화에 따른 해석의 신뢰성 평가 및 전달에 도움을 받을 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.