Skip to main content
QUICK REVIEW

[논문 리뷰] Feature Selection from High-Dimensional Data with Very Low Sample Size: A Cautionary Tale

Ludmila I. Kuncheva, Clare Matthews|arXiv (Cornell University)|2020. 08. 27.
Gene expression and cancer classification참고 문헌 65인용 수 14
한 줄 요약

이 논문은 생물정보학 및 멀티미디어 분야에서 흔한, 매우 낮은 표본 크기(예: 클래스당 10개의 인스턴스)를 가진 고차원 데이터셋에서의 특성 선택을 경고한다. 이는 20개의 실제 데이터셋에 대한 이론적 분석과 실험을 통해 수행되며, 이러한 방법들이 종종 오버피팅된 결과를 초래하고 잘못된 결론을 이끌 수 있음을 보여준다. 주요 발견은 특성 선택이 분류기와 적절히 매칭되지 않은 경우, 모든 특성을 사용하는 것보다 성능을 떨어뜨릴 수 있으며, 특히 교차검증이 이 영역에서 낙관적인 오차 추정에 대한 보호를 거의 제공하지 않는다는 점이다.

ABSTRACT

In classification problems, the purpose of feature selection is to identify a small, highly discriminative subset of the original feature set. In many applications, the dataset may have thousands of features and only a few dozens of samples (sometimes termed `wide'). This study is a cautionary tale demonstrating why feature selection in such cases may lead to undesirable results. In view to highlight the sample size issue, we derive the required sample size for declaring two features different. Using an example, we illustrate the heavy dependency between feature set and classifier, which poses a question to classifier-agnostic feature selection methods. However, the choice of a good selector-classifier pair is hampered by the low correlation between estimated and true error rate, as illustrated by another example. While previous studies raising similar issues validate their message with mostly synthetic data, here we carried out an experiment with 20 real datasets. We created an exaggerated scenario whereby we cut a very small portion of the data (10 instances per class) for feature selection and used the rest of the data for testing. The results reinforce the caution and suggest that it may be better to refrain from feature selection from very wide datasets rather than return misleading output to the user.

연구 동기 및 목표

  • 생물정보학 및 멀티미디어에서 흔한, 매우 적은 표본 수(예: 클래스당 10개)를 가진 고차원 데이터셋에서 특성 선택의 위험성과 한계를 조사한다.
  • 특성 선택이 오차 추정에 사용되는 데이터와 동일한 데이터에서 수행될 경우, 교차검증이 이와 같은 설정에서 과적합을 신뢰성 있게 방지한다는 가정을 도전한다.
  • 광범위한 데이터셋에서 추정된 오차와 진짜 분류 오차 간의 상관관계를 평가하며, 표본 수가 적을 경우 오차 추정의 불안정성을 부각한다.
  • 다양한 특성 선택기와 분류기의 조합이 미치는 영향을 평가하며, 순위 방법 선택보다 선택기와 분류기 간의 호환성이 훨씬 더 중요하다는 것을 드러낸다.
  • 20개의 실제 데이터셋을 활용한 실험적 증거를 제시하여, 특성 선택이 오히려 역효과를 낳을 수 있음을 보이며, 특히 매우 넓은 데이터셋에서는 경계하거나 회피하는 것이 바람직하다고 주장한다.

제안 방법

  • 특성 두 개를 신뢰성 있게 구별하기 위해 필요한 표본 크기의 이론적 유도를 통해, 신뢰할 수 있는 선택을 위해 수백 개의 표본이 필요할 수 있음을 보여준다.
  • 실제 20개의 데이터셋에서 실험적으로 평가하였으며, 특성 선택에는 클래스당 10개의 인스턴스만 사용하고, 나머지 데이터는 테스트를 위해 별도로 확보하여 극단적인 낮은 표본 크기 조건을 시뮬레이션하였다.
  • 오차 추정을 위해 이류-하나(LOO) 교차검증을 사용하였으며, 이 결과를 별도로 확보한 테스트 세트에서 측정한 진짜 오차와 비교하였다.
  • 10개의 특성 선택 방법(예: RFE, RelF, SU, EX10)과 5개의 분류기(예: NB, RF, SVM, 1NN, SVML)를 모든 데이터셋에 대해 체계적으로 비교하였다.
  • 왼쪽에 확보한 데이터에 대한 테스트 오차를 사용하여 성능을 평가하였으며, 결과 분석을 통해 선택기-분류기 조합의 영향과 순위 방법의 영향을 평가하였다.
  • 이론적으로 최적의 특성 부분집합을 도출하기 위해 전수 탐색(EX10)을 사용하였으며, 이를 비교 기준으로 삼았다.

실험 결과

연구 질문

  • RQ1분류 작업에서 두 특성을 신뢰성 있게 구별하기 위해 필요한 표본 크기는 얼마이며, 이는 낮은 표본 크기 조건에서 특성 선택의 가능성을 어떻게 규정하는가?
  • RQ2특성 선택이 매우 작은 데이터셋에서 수행될 경우, 교차검증 오차 추정치와 진짜 일반화 오차 간의 상관관계는 얼마나 되는가?
  • RQ3특성 선택기의 선택이 성능에 크게 영향을 미치는가, 아니면 선택기와 후속 분류기 간의 상호작용이 더 중요한가?
  • RQ4매우 넓은 데이터셋에서 특성 선택은 분류 정확도를 향상시킬 수 있는가, 아니면 과적합과 추정 편향으로 인해 성능을 떨어뜨릴 가능성이 더 높은가?
  • RQ5특히 어떤 조합의 선택기와 분류기 조합에서 특성 선택을 안전하게 적용할 수 있는가? 이는 고차원적이고 표본 수가 적은 데이터에서의 조건을 의미한다.

주요 결과

  • 클래스당 10개의 표본만 있는 매우 넓은 데이터셋에서 특성 선택은 일반화 성능이 떨어지는 경향이 있으며, 전수 탐색을 사용한 경우조차도 가장 성능이 좋은 특성 부분집합이 가장 낮은 진짜 오차와 일치하지 않는 경우가 많다.
  • 이류-하나(LOO) 오차 추정치는 별도의 테스트 세트에서 측정한 진짜 오차와 뚜렷한 상관관계를 보이지 않아, 이 영역에서는 오차 추정이 매우 신뢰할 수 없다는 것을 시사한다.
  • 분류기와 특성 선택기의 조합이 순위 방법의 선택보다 훨씬 중요하다. 예를 들어, 선형 분류기(NB, 1NN)는 모든 특성을 사용했을 때 가장 우수한 성능을 보였으며, 이는 특성 선택이 불필요하다는 것을 의미한다.
  • 계산 비용이 높은 선택기(RFE, EX10 등)는 간단하고 빠른 방법들에 비해 유의미하게 열등했으며, 이는 선택 과정에서 데이터를 과도하게 사용함으로써 과적합이 발생했음을 나타낸다.
  • 일부 데이터셋에서는 LOO 오차 기반으로 가장 성능이 좋은 특성 부분집합이 실제로는 가장 낮은 테스트 오차를 기록하지 못하는 경우가 있었으며, 이는 표본 수가 극도로 적을 경우 LOO 조차도 오해의 소지가 있음을 보여준다.
  • 이 연구는 매우 넓은 데이터셋에서는 특성 선택을 전혀 하지 않는 것이 오히려 더 낫다는 결론을 내린다. 이는 잘못된 결과와 과적합된 결과를 피하기 위함이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.