Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Recurrent Neural Networks for Sequential Phenotype Prediction in Genomics

Farhad Pouladi, Hojjat Salehinejad|arXiv (Cornell University)|2015. 11. 09.
Gene expression and cancer classification참고 문헌 25인용 수 4
한 줄 요약

이 논문은 유전체에서 순차적 형질 예측를 위한 새로운 ReLU 기반 학습 전략을 갖춘 깊이 있는 순환 신경망(DRNN)을 제안한다. 이는 유전자형 보정을 위해 행렬 분해를 결합하고, 장기적 의존성을 모델링하기 위해 RNN을 사용한다. 604명의 개체와 1980개의 SNP, 두 가지 형질로 구성된 데이터셋에서 ReLU-RNN은 훈련 정확도와 계산 효율성 면에서 LSTM-RNN과 SRNN을 모두 능가한다.

ABSTRACT

In analyzing of modern biological data, we are often dealing with ill-posed problems and missing data, mostly due to high dimensionality and multicollinearity of the dataset. In this paper, we have proposed a system based on matrix factorization (MF) and deep recurrent neural networks (DRNNs) for genotype imputation and phenotype sequences prediction. In order to model the long-term dependencies of phenotype data, the new Recurrent Linear Units (ReLU) learning strategy is utilized for the first time. The proposed model is implemented for parallel processing on central processing units (CPUs) and graphic processing units (GPUs). Performance of the proposed model is compared with other training algorithms for learning long-term dependencies as well as the sparse partial least square (SPLS) method on a set of genotype and phenotype data with 604 samples, 1980 single-nucleotide polymorphisms (SNPs), and two traits. The results demonstrate performance of the ReLU training algorithm in learning long-term dependencies in RNNs.

연구 동기 및 목표

  • 유전체에서 누락된 유전자형 데이터와 장기적 의존성 문제를 해결하기 위해 순차적 형질 예측에 도전한다.
  • 고차원적이고 다중공선성 있는 유전자 데이터를 기반으로 한 딥러닝을 통해 복잡한 질병 형질의 예측 성능을 향상시킨다.
  • 형질 시퀀스의 장기적 시간 패턴을 모델링하기 위해 LSTM-RNN의 계산 효율적인 대안을 개발한다.
  • 실제 유전자 데이터에서 기존 기법인 SPLS와 전통적인 RNN과의 비교를 통해 제안된 방법을 평가한다.
  • 유전체 응용 분야에서 순환 신경망에 대한 새로운 ReLU 기반 학습 전략의 효과성을 입증한다.

제안 방법

  • 낮은 랭크 근사와 F개의 잠재 특성으로 유전자형 누락 데이터를 보정하기 위해 행렬 분해(MF)를 적용한다.
  • 보정된 유전자형을 사용해 순차적 형질 예측을 위한 깊이 있는 순환 신경망(DRNN)을 훈련한다.
  • 형질 시퀀스의 장기적 의존성을 더 잘 포착하기 위해 RNN 훈련을 위한 새로운 ReLU 기반 학습 전략을 도입한다.
  • CPU와 GPU에서의 병렬 처리를 구현하여 훈련 효율성을 향상시킨다.
  • 손실 함수로 평균 제곱오차를 사용하여 ReLU-RNN을 표준 RNN(SRNN)과 장기 단기 기억 RNN(LSTM-RNN)과 비교한다.
  • 학습에 80%의 데이터, 검증에 10%, 테스트에 10%를 사용하며, 비교를 위해 SPLS를 기준선으로 적용한다.

실험 결과

연구 질문

  • RQ1LSTM과 SRNN과 비교해 복잡한 유전자형 예측에서 RNN의 장기적 의존성 학습을 향상시키기 위해 ReLU 기반 학습 전략이 효과적인가?
  • RQ2유전자형 예측 작업의 후속 단계에서 누락된 유전자형을 보정하기 위해 행렬 분해가 얼마나 효과적인가?
  • RQ3제안된 ReLU 기반 학습 전략을 갖춘 DRNN은 실제 유전자 데이터셋에서 SPLS보다 더 뛰어난 예측 성능을 보이는가?
  • RQ4행렬 분해에서 잠재 특성 수의 증가가 보정 정확도에 미치는 영향은 무엇인가?
  • RQ5유전자 시퀀스 모델링 맥락에서 ReLU-RNN의 계산 복잡도는 LSTM-RNN과 비교해 어떻게 되는가?

주요 결과

  • ReLU-RNN는 SRNN, LSTM-RNN, ReLU-RNN 중에서 가장 낮은 훈련 오차를 기록했으며, 100 에포크 후에 오차가 크게 감소했다.
  • 1000개의 잠재 특성을 가진 행렬 분해는 누락된 유전자형 보정 성공률 72.48%와 전체 유전자형 행렬 복원 정확도 97.56%를 달성했다.
  • ReLU-RNN은 형질 1에 대해 80.25%의 테스트 상관계수를 기록했고, 형질 2에 대해서는 78.29%를 기록했으며, 이는 SPLS의 51.53%와 56.42%를 능가하는 성과였다.
  • ReLU-RNN는 SRNN과 LSTM-RNN보다 더 빠른 수렴 속도와 낮은 훈련 오차를 보이며, 장기적 의존성에 대한 학습 역학이 뛰어나다는 것을 시사했다.
  • MF에서 잠재 특성 수를 늘일수록 보정 성능이 향상되었지만, 700개 이상에서는 수익 감소 현상이 나타났다.
  • ReLU-RNN는 성능을 유지하거나 초월하면서도 LSTM-RNN보다 낮은 계산 복잡도를 보였으며, 이는 대규모 유전자 데이터에 적합함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.