Skip to main content
QUICK REVIEW

[논문 리뷰] Feature Selection with the R Package MXM: Discovering Statistically-Equivalent Feature Subsets

Vincenzo Lagani, Giorgos Athineou|arXiv (Cornell University)|2016. 11. 10.
Gene expression and cancer classification인용 수 8
한 줄 요약

이 논문은 R 패키지 MXM에 구현된 SES(Statistically Equivalent Signatures) 알고리즘을 소개한다. 이 알고리즘은 예측 성능이 동일한 다수의 통계적으로 동등한 특징 부분집합을 식별하여, 단일 부분집합 특징 선택 방법보다 더 견고하고 해석 가능한 대안을 제공한다. SES는 예측 정확도에서 LASSO와 비슷하거나 뛰어나면서도 더 적은 수의 더 단순한 특징을 선택하여, 실제 데이터에서 다수의 동일한 예측 성능을 갖는 서명이 자연스럽게 존재함을 보여준다.

ABSTRACT

The statistically equivalent signature (SES) algorithm is a method for feature selection inspired by the principles of constrained-based learning of Bayesian Networks. Most of the currently available feature-selection methods return only a single subset of features, supposedly the one with the highest predictive power. We argue that in several domains multiple subsets can achieve close to maximal predictive accuracy, and that arbitrarily providing only one has several drawbacks. The SES method attempts to identify multiple, predictive feature subsets whose performances are statistically equivalent. Under that respect SES subsumes and extends previous feature selection algorithms, like the max-min parent children algorithm. SES is implemented in an homonym function included in the R package MXM, standing for mens ex machina, meaning 'mind from the machine' in Latin. The MXM implementation of SES handles several data-analysis tasks, namely classification, regression and survival analysis. In this paper we present the SES algorithm, its implementation, and provide examples of use of the SES function in R. Furthermore, we analyze three publicly available data sets to illustrate the equivalence of the signatures retrieved by SES and to contrast SES against the state-of-the-art feature selection method LASSO. Our results provide initial evidence that the two methods perform comparably well in terms of predictive accuracy and that multiple, equally predictive signatures are actually present in real world data.

연구 동기 및 목표

  • 기존 특징 선택 방법이 단일 부분집합만 반환하는 데서 비롯되는 한계를 해결하기 위해, 여러 부분집합이 동일하게 예측 가능할 수 있음을 고려한다.
  • 예측 성능이 최대화되고 크기가 최소화된 통계적으로 동등한 특징 부분집합을 식별하는 방법을 개발한다.
  • 분류, 회귀, 생존 분석에 활용할 수 있도록 오픈소스 R 패키지 MXM에 SES 알고리즘을 구현한다.
  • 실제 데이터에서 다수의 동등한 서명이 존재하고, SES가 이를 신뢰성 있게 복원할 수 있음을 경험적으로 검증한다.
  • LASSO와 비교하여 SES의 예측 성능, 안정성, 특징 집합 크기 측면에서의 성능을 평가한다.

제안 방법

  • SES 알고리즘은 베이지안 네트워크 구조 발견에 영감을 받은 제약 기반 학습 원리를 활용하여 통계적으로 동등한 특징 부분집합을 식별한다.
  • 조건부 독립성 검정을 적용하여 목표 변수를 예측하는 데 서로 대체 가능한 특징를 파악한다.
  • 예측 성능에서 통계적으로 구분되지 않는 최소 크기의 특징 집합(서명)을 식별한다.
  • MXM 패키지는 다양한 데이터 유형을 지원하기 위해 다수의 조건부 독립성 검정을 통해 SES를 구현한다.
  • 실제 데이터셋에 알고리즘을 적용하여 분류, 회귀, 생존 분석 과제에서 다수의 서명을 복원하고 비교한다.
  • 예측 정확도, 선택된 변수 수, 데이터 분할 간 안정성 등을 비교하여 성능을 평가한다.

실험 결과

연구 질문

  • RQ1실제 데이터셋에서 예측 성능이 유사한 다수의 통계적으로 동등한 특징 부분집합이 자연스럽게 존재하는가?
  • RQ2SES 알고리즘이 다양한 데이터 유형과 과제에서 이러한 동등한 서명을 안정적으로 식별하고 복원할 수 있는가?
  • RQ3SES의 예측 성능은 최신 기술인 LASSO와 비교하여 어떻게 되는가?
  • RQ4LASSO보다 SES가 데이터 분할 간 선택된 특징 수 측면에서 더 안정적인가?
  • RQ5SES가 복원한 서명들은 표본 수 제한으로 인한 통계적 구분 불가능성 때문이 아니라 데이터의 잠재적 중복성 때문인가?

주요 결과

  • 분석한 세 가지 실세계 데이터셋 전반에서 다수의 통계적으로 동등한 예측 특징 부분집합이 일관되게 식별되었으며, 이러한 동등성이 실생활에서 흔하다는 것을 시사한다.
  • SES가 복원한 서명의 예측 성능은 모든 데이터셋에서 매우 유사했으며, 평균 표준편차가 2.0 이하로 낮아 통계적 동등성이 확인되었다.
  • 유방암 데이터셋에서 SES는 평균 13.29개의 특징을 선택했고 표준편차는 5.91이었으며, LASSO는 평균 10.62개를 선택했지만 표준편차가 15.43로 훨씬 높아 SES의 안정성이 뛰어나다는 것을 보여주었다.
  • AquaticTox 데이터셋에서는 SES가 평균 5.68개의 특징(StD: 1.80)을 선택한 반면, LASSO는 평균 160.75개(StD: 66.34)를 선택하여 SES의 뛰어난 단순성(파라미터 수의 감소)을 입증했다.
  • 유방암 데이터셋에서는 LASSO가 SES를 略으로 뛰어넘었지만, SES는 훨씬 적은 특징 수로 유사한 성능을 달성하여 정확도와 모델 단순성 사이의 상충 관계를 보여주었다.
  • 결과적으로 SES는 더 단순한 모델을 제공하며 데이터의 숨겨진 동등성 구조를 드러내어 더 깊은 데이터 구조 이해를 가능하게 하며, LASSO 수준의 예측 정확도를 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.