Skip to main content
QUICK REVIEW

[논문 리뷰] Case-Based Reasoning for Assisting Domain Experts in Processing Fraud Alerts of Black-Box Machine Learning Models

Hilde Weerts, Werner van Ipenburg|arXiv (Cornell University)|2019. 07. 07.
Explainable Artificial Intelligence (XAI)참고 문헌 20인용 수 5
한 줄 요약

이 논문은 특성 값이 아닌 SHAP 설명 유사도를 기반으로 유사한 과거 예측을 검색하고 시각화함으로써 블랙박스 사기 탐지 모델의 신뢰도를 향상시키는 사례 기반 추론(CBR) 시스템을 제안한다. 이 방법은 도메인 전문가가 유사한 이전 사례가 어떻게 레이블링되었는지 보여줌으로써 경고 처리를 개선하며, 네덜란드의 주요 은행에서 실시한 실증 결과에 따르면 이 시스템은 효과적이며 사기 분석가들에게 유용하고 사용하기 쉬운 것으로 평가되었다.

ABSTRACT

In many contexts, it can be useful for domain experts to understand to what extent predictions made by a machine learning model can be trusted. In particular, estimates of trustworthiness can be useful for fraud analysts who process machine learning-generated alerts of fraudulent transactions. In this work, we present a case-based reasoning (CBR) approach that provides evidence on the trustworthiness of a prediction in the form of a visualization of similar previous instances. Different from previous works, we consider similarity of local post-hoc explanations of predictions and show empirically that our visualization can be useful for processing alerts. Furthermore, our approach is perceived useful and easy to use by fraud analysts at a major Dutch bank.

연구 동기 및 목표

  • 복잡한 블랙박스 기계학습 모델의 예측에 대한 신뢰성 평가 문제를 해결하기 위해.
  • 원시 신뢰도 점수나 고립된 SHAP 설명 외에도 도메인 전문가가 직관적이고 근거 기반의 지원을 통해 사기 경고를 처리할 수 있도록 돕기 위해.
  • 지역 모델 설명(예: SHAP 값)의 유사도가 특성 값 기반 유사도보다 사기 경고 처리에 더 나은 성능을 보이는지 조사하기 위해.
  • 실제 은행 환경에서 활동 중인 사기 분석가들을 대상으로 CBR 시스템의 인식된 유용성과 사용성 평가하기 위해.

제안 방법

  • 시스템은 두 단계 CBR 접근법을 사용한다: 먼저 새로운 사기 경고와 가장 유사한 k개의 과거 사례를 검색하고, 그 다음 검색된 이웃들의 진짜 레이블을 시각화한다.
  • 특성 값과 지역 설명 기여도를 모두 고려하는 새로운 거리 함수를 도입하여 지역 SHAP 설명 기반의 유사도를 측정한다.
  • 다양한 거리 함수를 평가한다: 특성 값 기반(dF), SHAP 기반(dS), 지역 가중치 기반(dL)이며, dS가 뛰어난 성능을 보였다.
  • 모델 신뢰도, SHAP 값, 그리고 유사 사례의 동적 이웃 시각화를 표시하는 파이썬 기반 대시보드에 시스템을 구현했다.
  • 사용자 평가에는 생각을 말하는 방식(think-aloud protocol)과 Davis(1989) 설문지를 사용하여 사기 분석가들 사이에서 인식된 유용성과 사용성 평가를 수행했다.
  • 사례 기반은 과거 사기 경고에서 구축되었으며, 유사도는 지역 설명 일관성을 강조하는 하이브리드 거리 함수를 사용해 측정되었다.

실험 결과

연구 질문

  • RQ1특성 값 기반 유사도보다 지역 SHAP 설명 유사도가 사기 경고 처리를 위한 관련 과거 사례 검색에 더 나은 성능을 보일 수 있는가?
  • RQ2다양한 사기 탐지 데이터셋에서 다양한 거리 함수(dF, dS, dL)의 성능은 어떻게 달라지는가?
  • RQ3실제 은행 환경에서 도메인 전문가들이 CBR 시스템을 얼마나 유용하고 사용하기 쉬운 것으로 인식하는가?
  • RQ4기존 결과가 알려진 유사 과거 사례를 시각화하면, 예측의 신뢰성 평가에 실질적인 증거를 제공하는가?

주요 결과

  • SHAP 기반 거리 함수(dS)는 특성 값 기반(dF) 및 지역 가중치 기반(dL) 함수보다 사례 검색 및 이웃 시각화에서 일관되게 뛰어난 성능을 보였으며, 특히 Phoneme 및 사기 탐지 데이터셋에서 두드러졌다.
  • Churn 데이터셋에서는 dF와 dL가 사례 검색에서 최고 성능을 보였고, dL는 이웃 시각화에서 최적의 성능을 보였다. 이는 거리 함수 선택이 데이터셋에 따라 민감할 수 있음을 시사한다.
  • 사기 분석가 4명을 대상으로 실시한 사용성 테스트에서 평균 유용성(M = 5.64/7)과 사용성(M = 5.96/7)이 모두 높아, 사용자 수용도가 높음을 나타냈다.
  • 구두 기록 분석 결과, 이웃 시각화가 사기 탐지 규칙에 대한 분석가의 직관을 모델 행동과 일치시키는 데 도움이 되었으며, 특히 초기 직관이 약한 사례에서 두드러졌다.
  • 검색된 이웃들의 진짜 레이블이 모델의 예측과 일치할 경우 시스템의 효과가 가장 뚜렷했으며, 이는 신뢰성에 대한 명확한 증거를 제공했다.
  • 본 연구는 SHAP 설명이 매우 군집 가능하다는 점을 입증하였으며, 향후 전역 모델 이해를 지원하기 위한 대표적 설명 기반 연구에 대한 잠재적 기반을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.