Skip to main content
QUICK REVIEW

[논문 리뷰] Shap-Select: Lightweight Feature Selection Using SHAP Values and Regression

Egor Kraev, Baran Koseoglu|arXiv (Cornell University)|2024. 10. 09.
Machine Learning and Data Classification인용 수 4
한 줄 요약

이 논문은 SHAP 값과 검증 세트에서의 통계적 유의성 검정을 사용하여 선형 회귀 또는 로지스틱 회귀를 통해 특성 선택을 이끄는 가벼운 해석 가능한 특성 선택 프레임워크인 shap-select을 제안한다. 이는 최소한의 계산 비용으로 최신 기술 성능을 달성하며, 신용카드 사기 데이터셋에서 높은 정확도(0.9996)와 F1 스코어(0.8701)를 유지하면서 단지 6개의 특성만 선택한다. 이는 Boruta, RFE, HISEL 및 기본 SHAP 기반 방법보다 효율성과 효과성 면에서 뛰어나다.

ABSTRACT

Feature selection is an essential process in machine learning, especially when dealing with high-dimensional datasets. It helps reduce the complexity of machine learning models, improve performance, mitigate overfitting, and decrease computation time. This paper presents a novel feature selection framework, shap-select. The framework conducts a linear or logistic regression of the target on the Shapley values of the features, on the validation set, and uses the signs and significance levels of the regression coefficients to implement an efficient heuristic for feature selection in tabular regression and classification tasks. We evaluate shap-select on the Kaggle credit card fraud dataset, demonstrating its effectiveness compared to established methods such as Recursive Feature Elimination (RFE), HISEL (a mutual information-based feature selection method), Boruta and a simpler Shapley value-based method. Our findings show that shap-select combines interpretability, computational efficiency, and performance, offering a robust solution for feature selection.

연구 동기 및 목표

  • 기계학습에서 불필요하거나 중복된 특성이 모델 성능을 떨어뜨리고 과적합 위험을 증가시키는 고차원 데이터 문제를 해결하기 위해.
  • 예측 성능를 유지하면서 모델 복잡성을 줄이는 계산적으로 효율적이고 해석 가능한 특성 선택 방법을 개발하기 위해.
  • SHAP 값과 통계적 유의성 검정을 통합하여 강력하고 히ュ리스틱 기반의 특성 선택 프레임워크를 구축하기 위해.
  • 금융 및 헬스케어 분야와 같이 해석 가능성과 효율성이 중요한 실세계 표본 데이터셋에 대해 이 방법을 평가하기 위해.
  • 실제 기계학습 파이프라인에서 쉽게 적용할 수 있도록 개방소스 도구를 제공하기 위해.

제안 방법

  • 프레임워크는 훈련된 모델을 사용하여 검증 세트에서 모든 특성에 대한 SHAP 값을 계산한다.
  • 목표 변수를 각 특성의 SHAP 값에 대해 선형 회귀 또는 로지스틱 회귀로 수행한다.
  • 특성 선택은 각 회귀 계수의 부호와 통계적 유의성(p-값)에 기반한다.
  • 유의미하지 않은 계수(p > 0.05)를 가진 특성은 단일 패assing 내에서 반복적으로 제거된다.
  • 기본 모델을 다양한 특성 조합에서 재학습하지 않아 계산 효율성이 보장된다.
  • 특성 선택을 제어하는 신뢰도 기준(기본값 5%)을 설정하며, 성능의 안정성을 검증하기 위해 민감도 분석을 수행한다.

실험 결과

연구 질문

  • RQ1SHAP 값과 회귀 유의성 검정을 조합하여 고차원 표본 데이터에서 효과적이고 효율적인 히ュ리스틱 기반 특성 선택이 가능한가?
  • RQ2Boruta, RFE, HISEL 및 단순 SHAP 기반 선택과 비교할 때 shap-select의 정확도, F1 스코어 및 런타임 측면에서의 성능은 어떠한가?
  • RQ3이 방법을 반복 적용하면 모델 성능이 향상되는가, 아니면 악화되는가?
  • RQ4특성 선택에 가장 적합한 신뢰도 기준은 무엇이며, 성능는 이 선택에 얼마나 민감한가?
  • RQ5특히 데이터가 적거나 노이즈가 많은 환경에서, 선택된 특성 수를 최소화하면서도 높은 성능를 유지할 수 있는가?

주요 결과

  • shap-select는 단지 6개의 특성만 선택하면서도 가장 높은 F1 스코어(0.870056)와 거의 완벽한 정확도(0.999596)를 달성하여 Boruta 및 RFE보다 두 지표에서 모두 뛰어난 성능를 보였다.
  • 이 방법은 21.8초의 런타임을 기록하여 Boruta(95.85초) 및 HISEL(109.03초)보다 빠르게 작동했으며, Boruta는 약간 더 높은 정확도를 기록했음에도 불구하고.
  • RFE 및 shap-selection은 더 빠른 런타임을 기록했음에도 불구하고, F1 스코어와 정확도에서 shap-select보다 열등했다.
  • HISEL은 모든 30개의 특성을 선택했고, 가장 느린 런타임(109.03초)을 기록했으며, 가장 낮은 F1 스코어(0.858757)를 기록하여 효율성과 성능의 균형이 떨어지는 것으로 나타났다.
  • shap-select를 반복 적용하면 모델 성능이 악화되어 단일 패assing이 최적임을 시사했다.
  • 민감도 분석을 통해 5%의 신뢰도 기준이 효과적이고 안정적이며, 다양한 기준에서의 성능 안정성으로 이를 검증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.