Skip to main content
QUICK REVIEW

[논문 리뷰] Gene selection for cancer classification using a hybrid of univariate and multivariate feature selection methods

Min Xu, Rudy Setiono|arXiv (Cornell University)|2015. 06. 05.
Gene expression and cancer classification참고 문헌 22인용 수 5
한 줄 요약

이 논문은 단일 변수 최대우도(LIK)와 다변량 순차적 특성 제거(RFE)를 조합한 하이브리드 유전자 선택 방법을 제안하여, 더 적은 수의 유전자로도 암 분류 정확도를 향상시킨다. LIK를 통해 초기 유전자 순위를 매기고, RFE를 통해 반복적인 특성 제거를 수행함으로써 노이즈 민감도와 계산 비용을 감소시키면서도, 백혈병 및 SRBCT 데이터셋에서 더 작은 유전자 집합으로도 우수하거나 동등한 정확도를 달성한다.

ABSTRACT

Various approaches to gene selection for cancer classification based on microarray data can be found in the literature and they may be grouped into two categories: univariate methods and multivariate methods. Univariate methods look at each gene in the data in isolation from others. They measure the contribution of a particular gene to the classification without considering the presence of the other genes. In contrast, multivariate methods measure the relative contribution of a gene to the classification by taking the other genes in the data into consideration. Multivariate methods select fewer genes in general. However, the selection process of multivariate methods may be sensitive to the presence of irrelevant genes, noises in the expression and outliers in the training data. At the same time, the computational cost of multivariate methods is high. To overcome the disadvantages of the two types of approaches, we propose a hybrid method to obtain gene sets that are small and highly discriminative. We devise our hybrid method from the univariate Maximum Likelihood method (LIK) and the multivariate Recursive Feature Elimination method (RFE). We analyze the properties of these methods and systematically test the effectiveness of our proposed method on two cancer microarray datasets. Our experiments on a leukemia dataset and a small, round blue cell tumors dataset demonstrate the effectiveness of our hybrid method. It is able to discover sets consisting of fewer genes than those reported in the literature and at the same time achieve the same or better prediction accuracy.

연구 동기 및 목표

  • 암 분류에서 단일 변수 및 다변량 유전자 선택 방법의 한계를 해결하기 위해.
  • 다변량 방법에서 불필요한 유전자, 노이즈 및 이방성에 대한 민감도를 감소시키기 위해.
  • 다변량 접근 방식의 높은 계산 비용을 낮추기 위해.
  • 정확도를 유지하거나 향상시키면서도 더 작은, 고도로 구분 가능한 유전자 집합을 식별하기 위해.
  • 단일 변수 및 다변량 방법을 상호보완적인 하이브리드 프레임워크로 통합하기 위해.

제안 방법

  • 유전자 분류에 대한 개별 유전자 기여도를 기반으로 초기 유전자 순위를 매기기 위해 단일 변수 최대우도(LIK)를 사용한다.
  • 유전자 간 상호작용을 고려하면서 덜 관련성이 높은 유전자를 반복적으로 제거하기 위해 다변량 순차적 특성 제거(RFE)를 적용한다.
  • 유전자 선택은 LIK를 통해 유전자를 순위 매기고, 이후 RFE를 통해 다변량 관련성에 기반해 집합을 정밀 조정한다.
  • 하이브리드 접근 방식은 LIK를 통해 조기 단계에서 노이즈와 불필요한 특징을 걸러내어, 계산 비용이 높은 RFE 프로세스의 영향을 줄인다.
  • 이 방법은 두 개의 마이크로어레이 데이터셋인 급성 백혈병 및 소형 원형 청색 세포 종양(SRBCT)에 대해 평가된다.
  • 특성 선택은 주로 분류 정확도를 성능 지표로 사용하여 검증된다.

실험 결과

연구 질문

  • RQ1단일 변수 및 다변량 방법을 융합한 하이브리드 접근 방식이 암 분류를 위한 유전자 선택을 향상시킬 수 있는가?
  • RQ2LIK와 RFE를 통합함으로써 선택된 유전자 수를 줄일 수 있으며, 정확도를 유지하거나 향상시킬 수 있는가?
  • RQ3제안된 방법은 기존의 단일 변수 및 다변량 방법에 비해 노이즈 및 이방성에 대해 더 뛰어난 강건성을 보이는가?
  • RQ4순수한 다변량 방법에 비해 하이브리드 방법은 계산 비용을 얼마나 줄일 수 있는가?
  • RQ5기존 문헌에서 보고된 바와 비교해, 하이브리드 방법은 더 작은, 더 구분력 있는 유전자 집합을 식별할 수 있는가?

주요 결과

  • 하이브리드 방법은 백혈병 및 SRBCT 데이터셋에서 최신 기술과 비교해 동등하거나 뛰어난 분류 정확도를 달성했다.
  • 이전 보고된 결과보다 유 significantly 적은 수의 유전자를 선택하면서도 높은 예측 성능를 유지했다.
  • 백혈병 데이터셋에서, 이 방법은 이전 연구에서 보고된 더 큰 유전자 집합과 비교해도 정확도를 맞추거나 초월하는 작은 유전자 집합을 식별했다.
  • SRBCT 데이터셋에서, 하이브리드 접근 방식은 개별 단일 변수 및 다변량 방법보다 유전자 집합 크기와 정확도 측면에서 뛰어난 성능을 보였다.
  • LIK와 RFE의 통합은 단독 다변량 방법보다 노이즈 및 이방성에 대한 강건성을 향상시켰다.
  • LIK를 통한 사전 필터링 덕분에 RFE 단계에 전달되는 유전자 수가 제한되어 계산 비용이 감소했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.