Skip to main content
QUICK REVIEW

[논문 리뷰] Spectral feature scaling method for supervised dimensionality reduction

Momo Matsuda, Keiichi Morikuni|arXiv (Cornell University)|2018. 05. 18.
Face and Expression Recognition참고 문헌 20인용 수 3
한 줄 요약

이 논문은 레이블이 부분적으로 제공된 데이터로부터 최적의 특징 스케일링 요소를 학습함으로써 분류 및 군집화 성능을 향상시키기 위해 스펙트럴 특징 스케일링을 사용하는 지도 학습 기반 차원 축소 방법을 제안한다. Fiedler 벡터와 선형 매트릭스 펜슬을 바탕으로 일반화된 고유값 문제를 수립함으로써, 감소된 공간에서의 분리 가능성 향상을 위해 특징을 적응적으로 재스케일링하는 방법이며, 합성 및 실제 유전자 발현 데이터셋 모두에서 기존 방법들을 능가한다. 특히 고차원, 저표본 환경에서 뛰어난 성능을 보인다.

ABSTRACT

Spectral dimensionality reduction methods enable linear separations of complex data with high-dimensional features in a reduced space. However, these methods do not always give the desired results due to irregularities or uncertainties of the data. Thus, we consider aggressively modifying the scales of the features to obtain the desired classification. Using prior knowledge on the labels of partial samples to specify the Fiedler vector, we formulate an eigenvalue problem of a linear matrix pencil whose eigenvector has the feature scaling factors. The resulting factors can modify the features of entire samples to form clusters in the reduced space, according to the known labels. In this study, we propose new dimensionality reduction methods supervised using the feature scaling associated with the spectral clustering. Numerical experiments show that the proposed methods outperform well-established supervised methods for toy problems with more samples than features, and are more robust regarding clustering than existing methods. Also, the proposed methods outperform existing methods regarding classification for real-world problems with more features than samples of gene expression profiles of cancer diseases. Furthermore, the feature scaling tends to improve the clustering and classification accuracies of existing unsupervised methods, as the proportion of training data increases.

연구 동기 및 목표

  • 특징의 비정규성과 불확실성으로 인한 고차원 데이터에서의 낮은 군집화 성능 문제를 해결하기 위해.
  • 부분적인 레이블 정보를 활용하여 특징 스케일링 요소를 학습함으로써 스펙트럴 군집화 및 분류 성능을 향상시키기 위해.
  • 감소된 특징 공간에서의 선형 분리 가능성 향상을 위해 적응적 특징 스케일링을 통한 지도 학습 방법을 개발하기 위해.
  • 완제품 문제와 실제 유전자 발현 데이터셋 모두에서 기존 방법들에 비해 우수하고 견고한 성능을 입증하기 위해.

제안 방법

  • 선형 매트릭스 펜슬을 포함하는 일반화된 고유값 문제를 수립함으로써, 고유벡터가 특징 스케일링 요소를 나타내도록 한다.
  • 사전 지식으로서 부분적인 샘플 레이블을 사용하여 Fiedler 벡터를 지정함으로써, 군집의 목적 구조에 맞게 스케일링 과정을 유도한다.
  • 모든 샘플에 대해 특징 스케일링을 적용하여 분산과 평균을 수정함으로써 감소된 공간에서의 분리 가능성 향상을 도모한다.
  • Laplacian 에igenmap를 적용하기 이전에 특징을 변환함으로써 스펙트럴 군집화와 통합함으로써 더 나은 군집 형성 가능성을 확보한다.
  • 유전자 발현 분석에서 흔한 고차원, 저표본 설정에서도 견고한 성능을 발휘하도록 설계되었다.
  • LPP 및 LFDA와 같은 기존 비지도 방법의 성능 향상을 위해 사전 처리 단계로 적용 가능하다.

실험 결과

연구 질문

  • RQ1부분적인 레이블 정보를 기반으로 한 특징 스케일링이 고차원 데이터에서 스펙트럴 군집화 성능을 향상시키는가?
  • RQ2기존의 지도 학습 기반 차원 축소 방법과 비교할 때, 지도 학습 기반 특징 스케일링은 군집화 및 분류 정확도에서 어떻게 성능을 내는가?
  • RQ3특징 스케일링이 표본 수가 특징 수보다 적은 실제 유전자 발현 데이터셋에서의 차원 축소의 견고성에 얼마나 기여하는가?
  • RQ4학습된 스케일링 요소와 결합했을 때, 제안된 방법이 비지도 스펙트럴 군집화의 성능을 향상시키는가?
  • RQ5레이블된 학습 데이터 비율이 증가함에 따라 제안된 방법이 성능을 유지하거나 향상시키는가?

주요 결과

  • 표본 수가 특징 수보다 많은 토이 문제에서는 제안된 방법이 기존의 지도 학습 방법들보다 군집화 및 분류 정확도에서 뛰어난 성능을 보였다.
  • 실제 유전자 발현 데이터셋(예: 난소, 췌장, IPF, 대장암)에서 제안된 방법은 기존 방법들보다 더 높은 랜드 지수(RI) 및 정규화된 상호정보량(NMI) 점수를 달성했다.
  • IPF 데이터셋에서 SC-S는 RI 76.1% ± 0.00과 NMI 0.093 ± 0.000을 기록하여 기준 방법들보다 뚜렷이 뛰어난 성능을 보였다.
  • 분류 작업에서는 IPF 데이터셋에서 SC-S가 97.4% ± 4.43의 정확도를 기록하여 KLFDA 및 LFDA와 같은 다른 방법들을 능가했다.
  • 레이블된 학습 데이터 비율이 증가함에 따라 군집화 성능에서 개선된 견고성을 보였다.
  • 특징 스케일링은 LPP 및 LFDA와 같은 기존 비지도 방법의 성능을 일관되게 향상시켰으며, 특히 고차원 환경에서 두드러진 효과를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.