Skip to main content
QUICK REVIEW

[논문 리뷰] Ensembling improves stability and power of feature selection for deep learning models

Prashnna Gyawali, Xiaoxia Liu|arXiv (Cornell University)|2022. 10. 02.
Machine Learning and Data Classification인용 수 5
한 줄 요약

이 논문은 딥러닝 모델에서 특성 선택의 안정성과 성능을 향상시키기 위해 여러 훈련 에포크와 하이퍼파라미터 설정에서 특성 중요도 점수를 앙상블하는 방법을 제안한다. 단일 최고 성능 모델에 의존하는 대신, 높은 성능을 보이는 다수의 모델에서 얻은 점수를 집계함으로써, 특히 낮은 신호 강도 또는 높은 특성 상관관계 조건에서 선택의 안정성과 통계적 검정력이 크게 향상된다.

ABSTRACT

With the growing adoption of deep learning models in different real-world domains, including computational biology, it is often necessary to understand which data features are essential for the model's decision. Despite extensive recent efforts to define different feature importance metrics for deep learning models, we identified that inherent stochasticity in the design and training of deep learning models makes commonly used feature importance scores unstable. This results in varied explanations or selections of different features across different runs of the model. We demonstrate how the signal strength of features and correlation among features directly contribute to this instability. To address this instability, we explore the ensembling of feature importance scores of models across different epochs and find that this simple approach can substantially address this issue. For example, we consider knockoff inference as they allow feature selection with statistical guarantees. We discover considerable variability in selected features in different epochs of deep learning training, and the best selection of features doesn't necessarily occur at the lowest validation loss, the conventional approach to determine the best model. As such, we present a framework to combine the feature importance of trained models across different hyperparameter settings and epochs, and instead of selecting features from one best model, we perform an ensemble of feature importance scores from numerous good models. Across the range of experiments in simulated and various real-world datasets, we demonstrate that the proposed framework consistently improves the power of feature selection.

연구 동기 및 목표

  • 훈련의 난수성과 비볼록 최적화로 인한 딥 네트워크에서 특성 중요도 점수의 불안정성 문제 해결
  • 낮은 신호 강도와 높은 특성 상관관계가 특성 할당 및 선택의 불안정성을 악화시키는 방식 탐구
  • 훈련 에포크와 하이퍼파라미터 설정을 기반으로 한 모델 앙상블을 활용해 특성 선택의 신뢰도 향상 프레임워크 개발
  • 노크오프 추론을 활용해 프레임워크의 효과성을 입증하여 선택의 안정성과 통계적 검정력을 향상시키기
  • 노크오프 방법을 초월해 딥러닝에서 다른 특성 선택 기법에도 일반화 가능한 접근 제공

제안 방법

  • 다양한 무작위 초기화와 하이퍼파라미터 설정에서 딥 네트워크를 훈련하여 다양한 모델 경로 생성
  • 교차검증 손실 기반으로 '좋은' 모델 선별: 검증 손실이 가장 낮은 상위 25% 모델 중심
  • 선택된 모델들의 특성 중요도 점수를 단순 평균을 통해 집계해 앙상블 점수 형성
  • 노크오프 추론을 앙상블 점수에 적용해 제어된 거짓 발동률(FDR)을 갖는 특성 선택 수행
  • 실세계 응용에서 안정성과 검출 능력을 향상시키기 위해 각 데이터셋에 대해 다수의 노크오프 샘플 사용
  • 단일 최고 성능 모델(가장 낮은 CV 손실 기반)에 의존하는 전통적 방법과의 비교 수행

실험 결과

연구 질문

  • RQ1딥러닝 모델의 훈련 난수성으로 인해 특성 중요도 점수가 불안정해지고 특성 선택이 일관성 없이 나타나는 정도는 어느 정도인가?
  • RQ2낮은 신호 강도나 높은 특성 상관관계와 같은 데이터 특성이 특성 중요도 및 선택의 안정성에 어떤 영향을 미치는가?
  • RQ3여러 훈련 에포크와 하이퍼파라미터 설정에서 특성 중요도 점수를 앙상블하면 특성 선택의 안정성과 검정력이 향상되는가?
  • RQ4단일 최고 성능 모델(가장 낮은 검증 손실 기반)에서 특성을 선택하는 전통적 방법에 비해 앙상블 방법이 선택 일관성과 통계적 검정력 측면에서 뛰어난가?
  • RQ5낮은 신호 대 잡음 비율과 고차원 특성을 지닌 실세계 생물학적 데이터셋에 대해 제안된 프레임워크를 효과적으로 적용할 수 있는가?

주요 결과

  • 유사한 검증 성능를 보이는 경우에도, 딥러닝 모델의 특성 중요도 점수는 훈련 런 간에 매우 높은 불안정성을 보인다.
  • 가장 낮은 검증 손실 기반 최고 성능 모델이 낮은 신호 또는 높은 상관관계 조건에서 항상 가장 안정적이거나 강력한 특성 선택을 보장하지는 않는다.
  • 훈련 에포크 동안 상위 성능를 보인 모델들의 특성 중요도 점수를 앙상블함으로써 선택 변동성이 크게 감소하고 안정성이 향상된다.
  • 앙상블 프레임워크는 제어된 FDR(q=0.2)를 유지하면서도 선택된 특성 수를 늘려, 특성 선택의 더 높은 통계적 검정력을 나타낸다.
  • 실세계 데이터셋(Peoteomics, 유방암, Pima 당뇨병)에서 앙상블 방법은 최고 성능 단일 모델이나 단순 평균보다 더 많은 특성을 선택하여 뛰어난 검정력을 입증했다.
  • 훈련 경로에서 열악한 품질의 모델 영향을 효과적으로 완화하여 더 견고하고 신뢰할 수 있는 특성 선택 결과를 이끌어냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.