Skip to main content
QUICK REVIEW

[논문 리뷰] Ultra High-Dimensional Nonlinear Feature Selection for Big Biological Data

Makoto Yamada, Jiliang Tang|arXiv (Cornell University)|2016. 08. 14.
Metabolomics and Mass Spectrometry Studies참고 문헌 48인용 수 9
한 줄 요약

이 논문은 초고차원 생물학적 데이터에서 최소한의 예측 능력이 뛰어나고 상호 중복성이 없는 특징들을 식별하기 위해 HSIC 라소와 분산 컴퓨팅을 결합한 확장 가능한 특징 선택 방법인 LAND(Landmark Angle Nonlinear Distributed)를 제안한다. 이는 실제로 프로스타트암 표현형과 효소 분류와 같은 실세계 데이터셋에서 예측 정확도를 유지하거나 향상시키면서도 차원 수를 최대 99.998%까지 감소시킨다.

ABSTRACT

Machine learning methods are used to discover complex nonlinear relationships in biological and medical data. However, sophisticated learning models are computationally unfeasible for data with millions of features. Here we introduce the first feature selection method for nonlinear learning problems that can scale up to large, ultra-high dimensional biological data. More specifically, we scale up the novel Hilbert-Schmidt Independence Criterion Lasso (HSIC Lasso) to handle millions of features with tens of thousand samples. The proposed method is guaranteed to find an optimal subset of maximally predictive features with minimal redundancy, yielding higher predictive power and improved interpretability. Its effectiveness is demonstrated through applications to classify phenotypes based on module expression in human prostate cancer patients and to detect enzymes among protein structures. We achieve high accuracy with as few as 20 out of one million features --- a dimensionality reduction of 99.998%. Our algorithm can be implemented on commodity cloud computing platforms. The dramatic reduction of features may lead to the ubiquitous deployment of sophisticated prediction models in mobile health care applications.

연구 동기 및 목표

  • 초고차원 생물학적 데이터셋(수백만 개의 특징, 수천 명의 샘플을 포함)에 비선형 기계학습을 적용하는 데 도전하는 데에 대비하기 위해.
  • 모델의 해석 가능성과 성능을 향상시키기 위해 최대한 예측 능력이 뛰어나고 상호 중복성이 최소인 특징들을 식별하는 특징 선택 방법을 개발하기 위해.
  • 기존 방법의 한계를 극복하고 일반적인 클라우드 플랫폼에서 비선형 특징 선택의 분산 및 확장 가능한 구현을 가능하게 하기 위해.
  • 실세계 생물학적 문제, 예를 들어 암 표현형 분류 및 효소 탐지 등에서 제안된 방법의 효과성을 입증하기 위해.

제안 방법

  • LAND는 비선형이고 중복성이 없는 특징 선택을 가능하게 하기 위해 최소각도회귀(LARS)와 힐버트-스미스 독립성 기준(HSIC)을 통합한다.
  • 전역적으로 최적인 희박한 특징 조합 선택을 보장하기 위해 LARS의 비음수 형태를 사용한다.
  • 메모리 복잡도를 $ O(dn^2) $ 에서 $ O(dbn) $ 으로 감소시키기 위해 $ b \ll n $ 인 파라미터를 사용하는 무작위 스케칭 기법을 적용하여 확장성 확보($ d \approx 10^6 $ 특징까지 가능).
  • 일반적인 클라우드 플랫폼에서 분산 방식으로 알고리즘을 구현하여 대규모 데이터셋의 효율적 처리를 가능하게 한다.
  • 선택된 특징과 목표 변수 간의 비선형 의존도(HSIC를 통해)를 최대화하고 특징 간 상호 중복도를 최소화하는 방식으로 특징 선택을 수행한다.
  • 효소 탐지 목적을 위해 단백질 구조를 고차원 벡터로 인코딩하기 위해 최대 4개의 잔기로 구성된 루트 기반 그래프릿을 특수한 특징 표현으로 사용한다.

실험 결과

연구 질문

  • RQ1100만 개 이상의 특징과 수천 명의 샘플을 포함하는 데이터셋에 대해 비선형 특징 선택 방법이 확장 가능한가?
  • RQ2분산 컴퓨팅이 초고차원 생물학적 데이터에서 비선형 특징 선택의 확장성과 효율성을 높이는데 효과적으로 활용될 수 있는가?
  • RQ3제안된 방법이 예측 정확도와 차원 수 감소 측면에서 최신의 선형 및 비선형 기준보다 뛰어나게 성능을 발휘하는가?
  • RQ4선택된 특징들이 생물학적으로 해석 가능한가? 예를 들어 효소에서 흔히 알려진 촉매 모티프인 DH(아미노산-히스티딘)를 식별할 수 있는가?

주요 결과

  • 효소 분류 작업에서 LAND는 특징 수를 1,062,420개에서 단 20개로 줄여 99.998%의 차원 수 감소를 달성하면서도 높은 정확도를 유지했다.
  • 전립선암 데이터셋에서 LAND는 100만 개의 특징 중 단 20개만을 사용하여도 높은 분류 정확도를 달성하여 낮은 중복성과 함께 강력한 예측 능력을 입증했다.
  • 특징 수가 100개 미만일 경우, 특히 초저차원 영역에서 mRMR 및 MR-NHSIC를 포함한 모든 기준보다 높은 정확도를 기록했다.
  • 동일한 효소 데이터셋에서 전체 그래프 커널 분류기의 경우 18일이 소요되었지만 LAND는 클러스터에서 단 3시간 만에 실행되어 극적인 속도 향상을 보였다.
  • 그림 6(B)의 중복도 분석을 통해 LAND가 기준보다 유의미하게 낮은 중복도를 가진 특징을 선택했음을 확인했다.
  • LAND는 기존에 알려진 촉매 부위에서 흔한 것으로 알려진 DH(아스파르트산-히스티딘) 그래프릿이라는 생물학적으로 관련성이 높은 모티프를 성공적으로 식별하여 생물학적 해석 가능성의 타당성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.