Skip to main content
QUICK REVIEW

[논문 리뷰] Evaluating Explainable Methods for Predictive Process Analytics: A Functionally-Grounded Approach

Mythreyi Velmurugan, Chun Ouyang|arXiv (Cornell University)|2020. 12. 08.
Business Process Modeling and Analysis인용 수 4
한 줄 요약

이 논문은 예측 프로세스 분석에서 설명 가능 AI 방법(LIME 및 SHAP)을 평가하기 위해 기능 기반 평가 지표인 충실도(fidelity)와 안정성(stability)를 제안한다. 세 개의 실세계 이벤트 로그에서 XGBoost 모델을 사용한 결과, 두 방법 모두 유사한 충실도를 보였지만 전반적인 충실도는 낮았으며, 특히 단일 버킷화와 집계 인코딩 조합에서 두드러지게 낮았고, 프리픽스 길이와 설명 품질 간 일관된 관계가 없었으며, 강력한 블랙박스 정확도에도 불구하고 실용적 구현의 과제를 드러냈다.

ABSTRACT

Predictive process analytics focuses on predicting the future states of running instances of a business process. While advanced machine learning techniques have been used to increase accuracy of predictions, the resulting predictive models lack transparency. Current explainable machine learning methods, such as LIME and SHAP, can be used to interpret black box models. However, it is unclear how fit for purpose these methods are in explaining process predictive models. In this paper, we draw on evaluation measures used in the field of explainable AI and propose functionally-grounded evaluation metrics for assessing explainable methods in predictive process analytics. We apply the proposed metrics to evaluate the performance of LIME and SHAP in interpreting process predictive models built on XGBoost, which has been shown to be relatively accurate in process predictions. We conduct the evaluation using three open source, real-world event logs and analyse the evaluation results to derive insights. The research contributes to understanding the trustworthiness of explainable methods for predictive process analytics as a fundamental and key step towards human user-oriented evaluation.

연구 동기 및 목표

  • 예측 프로세스 분석 분야에서 설명 가능 AI 방법의 체계적 평가 부족을 해결하기 위해.
  • 인간 평가에 의존하지 않고 설명 품질을 평가하기 위한 기능 기반 지표인 충실도(fidelity)와 안정성(stability)를 제안하기 위해.
  • 다양한 실세계 이벤트 로그에서 XGBoost 기반 예측 모델을 설명하는 LIME 및 SHAP의 성능을 평가하기 위해.
  • 데이터 인코딩, 버킷화 전략, 프리픽스 길이가 설명 품질에 미치는 영향을 규명하기 위해.
  • 프로세스 예측 환경에서 설명 가능 방법의 신뢰성과 실용적 한계에 대한 통찰을 제공하기 위해.

제안 방법

  • 기능 기반 평가 지표 제안: 설명 충실도(설명이 블랙박스 모델을 얼마나 잘 반영하는지)와 안정성(동일한 인스턴스의 변형에 대해 특성 중요도가 일관성 있게 유지되는지)을 정의.
  • 실세계 이벤트 로그 세 개인 Production, Sepsis Cases, BPIC2012에 대해 XGBoost 모델을 훈련한 후, LIME 및 SHAP을 후행적 설명 방법으로 적용.
  • 다양한 전처리 구성 사용: 단일 버킷화 대비 프리픽스 길이 기반 버킷화, 집계 인코딩 대비 인덱스 기반 인코딩.
  • 충실도 측정: 변형된 인스턴스에서 서rogate 모델(LIME/SHAP)의 예측을 원본 블랙박스 모델과 비교.
  • 안정성 측정: 동일 인스턴스의 다수의 변형에 대해 특성 중요도 순서의 유사도 계산.
  • 다양한 프리픽스 길이와 인코딩 방법을 대상으로 체계적인 실험 설계를 통해 설명 품질의 추세 분석.

실험 결과

연구 질문

  • RQ1실세계 프로세스 예측 작업에서 XGBoost 모델을 설명할 때 LIME 및 SHAP의 충실도는 어떻게 평가되는가?
  • RQ2다른 인코딩 및 버킷화 전략이 설명의 안정성과 충실도에 어떤 영향을 미치는가?
  • RQ3프리픽스 길이와 충실도 또는 안정성 간 일관된 관계가 존재하는가?
  • RQ4데이터셋의 특성(예: 크기, 희소성)이 설명 품질에 어떤 영향을 미치는가?
  • RQ5블랙박스 모델이 매우 정확하지만 복잡한 경우, 설명 방법의 신뢰성은 어느 정도 유지되는가?

주요 결과

  • LIME 및 SHAP는 대부분의 구성에서 유사한 충실도를 보였지만, 전반적인 충실도는 낮았으며, 특히 단일 버킷화와 집계 인코딩을 동시에 사용할 경우 두드러지게 낮았다.
  • 단일 버킷화와 집계 인코딩의 조합는 블랙박스 정확도를 극대화하지만, 설명의 충실도는 가장 낮아, 정확도와 설명 가능성 간의 상충관계를 시사한다.
  • 프리픽스 길이와 충실도 간 일관된 추세는 관찰되지 않았으며, BPIC2012 데이터셋을 제외하고는 프리픽스 길이가 길수록 충실도가 높아지는 경향이 있었는데, 이는 더 큰 프리픽스 길이에서 블랙박스 성능이 향상되었기 때문일 수 있다.
  • 안정성과 충실도 간 직접적인 상관관계가 없었으며, 낮은 안정성이라도 충실도가 낮지 않은 경우가 있었으며, 이는 앙상블 기반 설명 선택 전략이 안정성 문제를 완화할 수 있음을 시사한다.
  • 인덱스 기반 인코딩을 사용한 Sepsis Cases 데이터셋에서는 의사결정 경계(예측 확률 ≈ 0.5) 근처에서 설명의 충실도가 균일하게 유지되었지만, 더 확신 있는 예측에서는 정밀도가 떨어졌는데, 이는 모델의 과소적합과 데이터의 희소성 때문일 수 있다.
  • 결과적으로, 블랙박스 모델이 정확하더라도 설명 방법이 그 행동을 신뢰성 있게 반영하지 못할 수 있으며, 추가 보정 또는 방법 선별 없이선 실용적 활용이 제한됨을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.