Skip to main content
QUICK REVIEW

[논문 리뷰] SurvLIME-Inf: A simplified modification of SurvLIME for explanation of machine learning survival models

Lev V. Utkin, Maxim S. Kovalev|arXiv (Cornell University)|2020. 05. 05.
Explainable Artificial Intelligence (XAI)참고 문헌 57인용 수 4
한 줄 요약

이 논문은 SurvLIME의 단순화된 변형인 SurvLIME-Inf를 제안한다. SurvLIME-Inf는 누적 위험 함수 간의 이질성 측정에 $L_{\infty}$-노름(체비셰프 거리)을 사용하여 블랙박스 생존 모델을 해석한다. 설명 작업을 선형 프로그래밍 문제로 재구성함으로써, SurvLIME가 $L_2$-노름 최적화에 의존하는 것과는 달리 SurvLIME-Inf는 더 빠른 계산 속도와 더 나은 성능을 달성하며, 특히 소규모 학습 데이터셋에서 뛰어난 성능을 발휘한다.

ABSTRACT

A new modification of the explanation method SurvLIME called SurvLIME-Inf for explaining machine learning survival models is proposed. The basic idea behind SurvLIME as well as SurvLIME-Inf is to apply the Cox proportional hazards model to approximate the black-box survival model at the local area around a test example. The Cox model is used due to the linear relationship of covariates. In contrast to SurvLIME, the proposed modification uses $L_{\infty }$-norm for defining distances between approximating and approximated cumulative hazard functions. This leads to a simple linear programming problem for determining important features and for explaining the black-box model prediction. Moreover, SurvLIME-Inf outperforms SurvLIME when the training set is very small. Numerical experiments with synthetic and real datasets demonstrate the SurvLIME-Inf efficiency.

연구 동기 및 목표

  • 학습 데이터가 제한된 상황에서 블랙박스 기계학습 생존 모델을 해석하는 데 도전하는 데 목적을 두며.
  • 계산 효율성과 안정성을 향상시키기 위해 최적화 프레임워크를 단순화함으로써 SurvLIME을 개선하는 데 목적을 두며.
  • 코ックス 비례 위험 모델을 서rogate로 사용하여 개별 예측에 대한 국소적 후행 해석을 가능하게 하는 데 목적을 두며.
  • 누적 위험 함수 간의 거리 측정에 $L_{\infty}$-노름을 활용하여 생존 분석의 해석 가능성 향상에 기여하는 데 목적을 두며.
  • 모델 투명성이 핵심적인 의료 및 위험 평가 응용 분야를 지원하는 데 목적을 두며.

제안 방법

  • 이 방법은 블랙박스 생존 모델의 테스트 인스턴스에서의 예측을 해석하기 위해 국소 서로서테이터로 코克斯 비례 위험 모델을 사용한다.
  • 테스트 포인트 주변에 합성 인스턴스를 생성하고, 블랙박스 모델을 사용해 그들의 누적 위험 함수를 계산한다.
  • 블랙박스 모델과 근사 코克斯 모델의 누적 위험 함수 간의 최대 절대 차이를 측정하기 위해 $L_{\infty}$-노름(체비셰프 거리)을 사용한다.
  • 이를 통해 설명 문제를 코克斯 모델 계수를 추정하기 위한 선형 프로그래밍 최적화 작업으로 변환한다.
  • 이 방법은 모델에 종속적이지 않으며, 랜덤 생존 숲 및 딥 러닝 모델을 포함한 모든 생존 모델에 적용 가능하다.
  • 이 방법은 시뮬레이션 데이터와 실제 데이터셋(Veteran, LUNG, PBC)을 대상으로 검증되었으며, 관찰 결과가 제한된 생존 결과를 포함한다.

실험 결과

연구 질문

  • RQ1SurvLIME에서 $L_2$-노름을 $L_{\infty}$-노름으로 대체하면 설명 정확도와 계산 효율성이 향상되는가?
  • RQ2학습 데이터가 부족한 상황에서 SurvLIME-Inf가 SurvLIME를 능가하는가?
  • RQ3SurvLIME-Inf는 국소 근사에서 생존 함수 및 누적 위험 함수의 형태를 얼마나 잘 유지하는가?
  • RQ4SurvLIME-Inf는 개별 생존 예측에 대해 신뢰할 수 있고 해석 가능한 기여도 순위를 제공하는가?
  • RQ5SurvLIME에서 사용하는 볼록 최적화에 비해 SurvLIME-Inf의 선형 프로그래밍 설정이 데이터 정밀도 저하에 더 강건한가?

주요 결과

  • SurvLIME-Inf는 소규모 학습 세트에서 SurvLIME를 크게 능가하며, $n = 10$ 및 $n = 20$일 때 모델 근사 및 진짜 누적 위험 함수에 대해 루트 평균 제곱 오차(RMSE)가 모두 낮아진다.
  • $n = 10$일 때, $RMSE_{\text{model}}$는 SurvLIME의 0.719에서 SurvLIME-Inf의 0.290으로 감소하고, $RMSE_{\text{true}}$는 0.809에서 0.575로 감소한다.
  • $n = 20$일 때, $RMSE_{\text{model}}$는 0.659에서 0.358로 감소하고, $RMSE_{\text{true}}$는 0.664에서 0.460으로 감소한다.
  • 학습 세트 크기가 증가함에 따라 SurvLIME-Inf의 성능 우위는 점점 줄어들며, $n = 30$ 및 $n = 40$에서 두 방법이 수렴한다.
  • 실제 데이터셋(Veteran, LUNG, PBC)에 대한 수치적 결과는 SurvLIME-Inf가 정확하고 시각적으로 일관된 생존 함수 근사 결과를 생성함을 확인한다.
  • $L_{\infty}$-노름의 사용은 선형 프로그래밍 설정을 가능하게 하여 계산을 단순화하고 소규모 데이터 시나리오에서의 확장성 향상에 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.