Skip to main content
QUICK REVIEW

[논문 리뷰] Feature Selection through Minimization of the VC dimension

Jayadeva, Sanjit Singh Batra|arXiv (Cornell University)|2014. 10. 27.
Face and Expression Recognition참고 문헌 28인용 수 4
한 줄 요약

이 논문은 VC 차원을 최소화하는 데 사용되는 최소 복잡도 기계(MCM)를 활용해 희소하고 고도로 구분 가능한 특성 부분집합을 식별하는 새로운 특성 선택 방법을 제안한다. 선형 MCM 분류기를 훈련시켜 자연스럽게 희소성을 유도함으로써, 총 특성의 약 0.6% 미만으로 가장 관련성이 높은 특성들만 선택한다. 이로써 ReliefF 및 FCBF와 비슷하거나 더 높은 테스트 정확도를 달성하면서도 특성 수를 크게 줄였다.

ABSTRACT

Feature selection involes identifying the most relevant subset of input features, with a view to improving generalization of predictive models by reducing overfitting. Directly searching for the most relevant combination of attributes is NP-hard. Variable selection is of critical importance in many applications, such as micro-array data analysis, where selecting a small number of discriminative features is crucial to developing useful models of disease mechanisms, as well as for prioritizing targets for drug discovery. The recently proposed Minimal Complexity Machine (MCM) provides a way to learn a hyperplane classifier by minimizing an exact (\boldmath{$Θ$}) bound on its VC dimension. It is well known that a lower VC dimension contributes to good generalization. For a linear hyperplane classifier in the input space, the VC dimension is upper bounded by the number of features; hence, a linear classifier with a small VC dimension is parsimonious in the set of features it employs. In this paper, we use the linear MCM to learn a classifier in which a large number of weights are zero; features with non-zero weights are the ones that are chosen. Selected features are used to learn a kernel SVM classifier. On a number of benchmark datasets, the features chosen by the linear MCM yield comparable or better test set accuracy than when methods such as ReliefF and FCBF are used for the task. The linear MCM typically chooses one-tenth the number of attributes chosen by the other methods; on some very high dimensional datasets, the MCM chooses about $0.6\%$ of the features; in comparison, ReliefF and FCBF choose 70 to 140 times more features, thus demonstrating that minimizing the VC dimension may provide a new, and very effective route for feature selection and for learning sparse representations.

연구 동기 및 목표

  • 고차원 데이터에서 일반화 성능을 향상시키기 위해 최소이면서도 고도로 구분 가능한 특성 부분집합을 선택하는 데 도전하는 것.
  • 모델 복잡도의 이론적 기반 측정치인 VC 차원을 특성 선택 기준으로 삼아 과적합과 계산 비용을 줄이는 것.
  • 랩퍼 방법의 높은 계산 비용을 피하고 필터 방법의 한계를 극복하기 위해 보편적이고 반복 없으며 확장 가능한 특성 선택 방법을 개발하는 것.
  • VC 차원 최소화가 기존 최첨단 방법과 비슷하거나 뛰어난 예측 성능를 유지하거나 초월하는 희소 표현을 이끌어낼 수 있음을 입증하는 것.

제안 방법

  • 선형 MCM는 VC 차원의 정확한 상한을 최소화하도록 훈련되며, 이는 가중치 벡터의 희소성을 자연스럽게 촉진한다.
  • MCM 해에서 비영인 가중치에 해당하는 특성이 후속 분류를 위한 가장 관련성이 높은 특성으로 선택된다.
  • 선택된 특성들에 대해 가우시안 RBF 커널을 사용한 커널 SVM을 훈련하여 일반화 성능를 평가한다.
  • MCM 최적화 문제는 유효한 마진과 노름에 대한 제약 조건을 포함한 이차계획문으로 공식화되어 볼록 프로그래밍을 통해 해결된다.
  • 특성 수와 직접적으로 연결되는 비제로 특성 수에 의존하는 VC 차원에 대한 이론적 경계를 사용한다.
  • 반복적 검색 없이 단일 패assing으로 특성 선택이 이루어져 랩퍼 방법 대비 계산 효율성이 뛰어나다.

실험 결과

연구 질문

  • RQ1VC 차원 최소화가 고차원 데이터셋에서 효과적이고 이론적으로 타당한 특성 선택 기준이 될 수 있는가?
  • RQ2VC 차원 최소화에 기반한 특성 선택 방법이 ReliefF 및 FCBF와 같은 기존의 필터 방법보다 정확도와 희소성 측면에서 뛰어나게 성능을 발휘하는가?
  • RQ3MCM가 특성 선택 수를 크게 줄이면서도 테스트 정확도를 유지하거나 향상시키는 희소 표현을 얼마나 잘 생성할 수 있는가?
  • RQ4MCM 기반 특성 선택 방법은 다양한 차원과 표본 크기를 가진 다양한 벤치마크 데이터셋에서 확장 가능하고 견고한가?

주요 결과

  • West 데이터셋(49 × 7129)에서 MCM는 총 특성의 0.45%에 해당하는 32개 특성만 선택하여 79.7% ± 6.8%의 테스트 정확도를 달성했으며, 이는 ReliefF(2207개 특성, 65.3% ± 3.2%)와 FCBF(1802개 특성, 59.19% ± 3.1%)를 모두 뛰어넘었다.
  • Golub 데이터셋(72 × 7129)에서 MCM는 총 특성의 0.66%에 해당하는 47개 특성만 선택하여 95.8% ± 4.2%의 정확도를 기록했으며, FCBF(7129개 특성)와 동일하고 ReliefF(2271개 특성, 90.3% ± 4.8%)를 뛰어넘었다.
  • Singh 데이터셋(102 × 12600)에서 MCM는 총 특성의 0.64%에 해당하는 81개 특성만 선택하여 91.2% ± 3.9%의 정확도를 달성했으며, ReliefF(5650개 특성, 89.2% ± 2.0%)를 뛰어넘고 FCBF(11619개 특성, 92.5% ± 2.7%)와 동등한 성능을 보였다.
  • 모든 벤치마크 데이터셋에서 MCM는 ReliefF 및 FCBF 대비 선택된 특성 수의 1/10 미만을 지속적으로 선택하면서도 테스트 정확도를 유지하거나 향상시켰다.
  • Christensen 데이터셋(198 × 1413)에서는 모든 방법이 거의 완벽한 성능(99.5% ± 0.7%)을 보였지만, MCM는 총 특성의 6.9%에 해당하는 98개 특성만 선택했고, ReliefF는 633개, FCBF는 1413개를 선택했다.
  • MCM가 희소 표현을 학습할 수 있음을 확인한 것은, 커널 MCM에서 지지 벡터의 수가 표준 SVM의 10분의 1 미만이었기 때문에 일반화 성능와 희소성 측면에서 강력한 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.