Skip to main content
QUICK REVIEW

[논문 리뷰] Feature Selection for Microarray Gene Expression Data using Simulated Annealing guided by the Multivariate Joint Entropy

Fernando González‐Pérez, Lluís Belanche|arXiv (Cornell University)|2013. 02. 07.
Gene expression and cancer classification참고 문헌 8인용 수 5
한 줄 요약

이 논문은 다변량 결합 엔트로피로 유도된 시뮬레이션된 난류를 사용하여 마이크로어레이 데이터에서 생물학적으로 관련성이 있는 유전자 집합을 식별하는 새로운 특성 선택 알고리즘 μ-TAFS를 제안한다. 이전 계산을 재사용함으로써 효율적으로 결합 엔트로피를 계산함으로써, 최소한의 서브셋 크기로 높은 분류 정확도를 달성하며, 다섯 개인 공개 마이크로어레이 데이터셋에서 낮은 계산 비용으로 뛰어난 성능을 보였다.

ABSTRACT

In this work a new way to calculate the multivariate joint entropy is presented. This measure is the basis for a fast information-theoretic based evaluation of gene relevance in a Microarray Gene Expression data context. Its low complexity is based on the reuse of previous computations to calculate current feature relevance. The mu-TAFS algorithm --named as such to differentiate it from previous TAFS algorithms-- implements a simulated annealing technique specially designed for feature subset selection. The algorithm is applied to the maximization of gene subset relevance in several public-domain microarray data sets. The experimental results show a notoriously high classification performance and low size subsets formed by biologically meaningful genes.

연구 동기 및 목표

  • 수천 개의 유전자와 적은 수의 샘플을 가진 고차원 마이크로어레이 데이터에서, 기존의 특성 선택 방법이 계산적으로 비현실적인 문제를 해결하기 위해.
  • 고차원 공간에서 효율적인 최적화를 가능하게 하는 빠른 정보이론적 목적 함수를 개발하여 유전자 관련성을 측정하기 위해.
  • 지나친 국소 최적값에 갇히지 않으면서도 대규모 유전자 발현 데이터에 대해 계산적으로 실현 가능한 시뮬레이션된 난류 기반의 검색 알고리즘을 설계하기 위해.
  • 암 아형 예측에서 높은 분류 정확도를 달성하는 소규모 생물학적으로 의미 있는 유전자 서브셋을 식별하기 위해.
  • 기존 최첨단 접근 방식과의 성능 비교를 위해 공개 마이크로어레이 데이터셋에서 방법을 평가하기 위해.

제안 방법

  • 범주형 변수에 대한 다변량 결합 엔트로피의 새로운 정확하고 효율적인 계산 방법을 도입하여 이전 계산을 재사용함으로써 복잡도를 감소시켰다.
  • 목적 함수는 다변량 결합 엔트로피에 기반하며, 특성 간의 종속성을 반영하는 방식으로 유전자 서브셋의 관련성을 측정한다.
  • 최적의 특성 서브셋을 찾기 위해 특수화된 시뮬레이션된 난류 알고리즘(μ-TAFS)을 사용하며, 국소 최소값에서 벗어나기 위해 더 나쁜 해를 확률적으로 수용한다.
  • 알고리즘은 에너지 차이와 온도 감쇠에 기반하여 이웃 서브셋을 반복적으로 탐색하고 수용 또는 기각함으로써 유전자 서브셋의 관련성을 최대화하도록 설계되었다.
  • 시뮬레이션된 난류 프레임워크에 결합 엔트로피 계산을 통합하여 예측 모델을 훈련시키지 않고도 후보 서브셋의 평가를 신속하게 수행할 수 있도록 하였다.
  • 이 방법은 다섯 개인 공개 마이크로어레이 데이터셋에 적용되었으며, 교차 검증을 사용하여 분류 성능을 평가하였다.

실험 결과

연구 질문

  • RQ1고차원 마이크로어레이 데이터에서 특성 선택을 유도하기 위해 효율적인 다변량 결합 엔트로피의 정보이론적 측정법을 사용할 수 있는가?
  • RQ2결합 엔트로피로 유도된 시뮬레이션된 난류 기반의 검색이 기존의 특성 선택 방법보다 분류 정확도와 서브셋 크기 측면에서 뛰어나게 성능을 발휘하는가?
  • RQ3결합 엔트로피 계산에서 이전 계산을 재사용하면 특성 서브셋 평가의 시간 복잡도를 크게 감소시킬 수 있는가?
  • RQ4선택된 유전자 서브셋은 생물학적으로 의미 있고 알려진 암 관련 유전자와 일관성이 있는가?
  • RQ5기준 마이크로어레이 데이터셋에서 μ-TAFS는 최첨단 방법과 비교해 성능과 계산 효율성 측면에서 어떻게 성과를 내는가?

주요 결과

  • μ-TAFS 알고리즘은 다섯 개인 공개 마이크로어레이 데이터셋에서 높은 분류 성능을 빼어나게 달성하였으며, 최첨단 방법을 뛰어넘거나 동등하게 성과를 냈다.
  • 선택된 유전자 서브셋은 일관되게 작았으며, 예측 정확도를 유지하거나 향상시키면서도 차원의 저감을 극적으로 감소시켰다.
  • 이 방법은 폐암, 전립선암, 유방암과 관련이 있는 것으로 알려진 DEC1, MTMR11, HPN, CYP24A1와 같은 생물학적으로 관련성이 있는 유전자들을 식별하였다.
  • 목적 함수로 결합 엔트로피를 사용함으로써 후보 서브셋 평가가 신속하게 수행되어, 기존의 표준 SA 기반 접근 방식에 비해 계산 시간을 크게 단축시켰다.
  • 알고리즘은 알려진 옹성유전자와 종양억제유전자를 성공적으로 식별하여 선택된 특성의 생물학적 의미를 검증하였다.
  • 결과적으로 제안된 결합 엔트로피 계산은 정확하고 효율적이며, 고차원 데이터에서 확장 가능한 특성 선택을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.