Skip to main content
QUICK REVIEW

[논문 리뷰] Unbiased Measurement of Feature Importance in Tree-Based Methods

Zhengze Zhou, Giles Hooker|arXiv (Cornell University)|2019. 03. 12.
Statistical Methods and Inference참고 문헌 42인용 수 17
한 줄 요약

이 논문은 트리 기반 모델을 위한 편향 없는 특성 중요도 측정 방법을 제안한다. 기존의 Gini 중요도와 같은 전통적인 분할 개선도 측정 방식은 더 많은 잠재적 분할을 가진 특성들을 선호하는 본질적 편향을 내재하고 있으나, 이 방법은 검증되지 않은 데이터에서의 분할 개선도를 사용하여 이를 보정한다. 이로 인해 연속형 또는 고카디널리티가 높은 범주형 특성에 대한 허위 중요도가 감소하고, 귀무가설 하에서 편향 없는 추정이 보장되며, 계산 비용은 최소화되고 scikit-learn 및 randomForest와 같은 기존 라이브러리에 쉽게 통합될 수 있다.

ABSTRACT

We propose a modification that corrects for split-improvement variable importance measures in Random Forests and other tree-based methods. These methods have been shown to be biased towards increasing the importance of features with more potential splits. We show that by appropriately incorporating split-improvement as measured on out of sample data, this bias can be corrected yielding better summaries and screening tools.

연구 동기 및 목표

  • 연속형 또는 고카디널리티가 높은 범주형 변수와 같이 더 많은 잠재적 분할을 가진 특성들을 선호하는, 잘 알려진 분할 개선도 기반 특성 중요도 측정 방식의 편향 문제를 해결하기 위해.
  • 훈련 데이터에 과적합되지 않도록 검증되지 않은 데이터를 사용해 분할 개선도를 추정하는 단순하고 계산 효율적인 해결책을 개발하기 위해.
  • scikit-learn 및 randomForest와 같은 인기 있는 라이브러리에서 현재 사용 중인 편향된 내부 데이터 기반 측정 방식의 이론적으로 타당한 편향 없는 대안을 제공하기 위해.
  • 모의 및 실제 데이터셋을 대상으로 실험적으로 방법의 타당성을 검증하여, 특성 선별 및 순위 매기기에서 더 높은 신뢰성을 확보하기 위해.
  • 예측 능력이 없는 특성이 기대값으로 0의 중요도를 가지게 하여, 더 신뢰할 수 있는 모델 해석과 후속 분석을 가능하게 하기 위해.

제안 방법

  • 내부 데이터 기반 분할 개선도를 검증되지 않은 데이터 기반 분할 개선도로 대체함으로써, 훈련 데이터에 대한 과적합을 방지한다.
  • 숲의 각 트리에서, 분할 시의 불순도 감소 개선도는 트리를 구축하는 데 사용된 훈련 세트가 아니라 검증되지 않은 데이터에서 측정된다.
  • 최종 특성 중요도는 모든 트리와 분할에 걸쳐 이러한 검증되지 않은 데이터 기반 분할 개선도의 평균값을 취함으로써 편향 없는 추정을 보장한다.
  • 기존 트리 구축 프레임워크와 호환되며, 분할 개선도 집계 방식만 변경되기 때문에 코드 수정이 최소화된다.
  • 검증되지 않은 데이터가 자연스럽게 존재하는 환경, 예를 들어 교차 검증 또는 분할된 테스트 세트와 같은 경우에 대한 성질을 고려해, 정직한 트리나 다른 설정으로도 확장 가능하다.
  • 이론적 근거를 제공하여, 귀무가설(예측 능력이 없음) 하에서 기대 중요도가 0이 됨을 보여준다.

실험 결과

연구 질문

  • RQ1Random Forest에서 표준 분할 개선도 측정 방식이 더 많은 잠재적 분할을 가진 특성들, 특히 연속형 또는 고카디널리티가 높은 범주형 변수들에 대해 체계적인 편향을 보이는가?
  • RQ2검증되지 않은 데이터 기반 분할 개선도 추정이 이러한 편향을 보정하고 더 신뢰할 수 있는 특성 중요도 순위를 제공할 수 있는가?
  • RQ3제안된 편향 없는 측정 방식이 실제 및 모의 데이터에서 기존의 방법들, 예를 들어 순열 중요도와 cforest와 비교하여 어떻게 성능을 발휘하는가?
  • RQ4제안된 방법이 이진형, 범주형, 연속형 변수 등 다양한 특성 유형에 대해 강건한가?
  • RQ5편향 없는 측정 방식이 트리 기반 모델에서 가설 검정이나 신뢰구간과 같은 공식적인 통계적 추론을 지원할 수 있는가?

주요 결과

  • Random Forest에서의 표준 분할 개선도 측정 방식은 연속형 또는 고카디널리티가 높은 범주형 변수처럼 더 많은 잠재적 분할을 가진 특성들에 대해 심각한 편향을 보인다.
  • 10개의 노이즈 특성이 포함된 시뮬레이션에서, 제안된 편향 없는 특성 중요도(UFI)는 유일한 진짜 예측 변수를 정확히 식별한 반면, 표준 분할 개선도(SI)는 노이즈 특성을 더 높은 순위로 평가했다.
  • Adult 및 Boston Housing 데이터셋에서 UFI는 SI보다 더 자연스럽고 일관된 특성 순위를 도출했으며, 무작위 특성은 거의 0에 가까운 중요도를 기록했다.
  • UFI의 중요도 점수는 cforest 및 ranger와 같은 최첨단 두 가지 방법의 결과와 일치하여 강력한 경험적 타당성을 보였다.
  • Random Forest에서 out-of-bag 샘플이 이미 존재하므로, 표준 학습 외에 추가 계산 비용이 전혀 들지 않으며, 이는 방법의 효율성을 뒷받침한다.
  • 이론적 분석을 통해, 예측 능력이 없는 특성들이 제안된 방법 하에서 기대 중요도가 0이 됨을 확인하여, 편향 없는 성질을 만족함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.