Skip to main content
QUICK REVIEW

[논문 리뷰] Virus genome sequence classification using features based on nucleotides, words and compression

T. Wang, Mark Herbster|arXiv (Cornell University)|2018. 09. 11.
Genomics and Phylogenetic Studies참고 문헌 55인용 수 5
한 줄 요약

이 논문은 아미노산 서열이 아닌, 뉴클레오티드, k-mer, 압축 기반의 정렬 무관 특징을 활용하여 바이러스 게놈을 ICTV 주문으로 분류하는 기계학습 프레임워크를 제안한다. SVM를 사용한 4-mer 카운트로 평균 오류율이 0.006에 불과하며, 다른 특징-분류기 조합보다 뚜렷하게 뛰어나며, 생물학적 맥락이 없는 1,834개의 분류되지 않은 바이러스에 대해 주문을 성공적으로 예측하였다. 이 중 16개는 후속 RefSeq 할당과 일치하였다.

ABSTRACT

The ICTV develops, refines and maintains a universal virus taxonomy; Order is the highest taxon in the branching hierarchy of recognised viral taxa. Historically, ICTV (sub)committees have classified viruses on the basis of morphological characteristics and various other attributes. Today, virtually all new viral genomes are assembled from metagenomic datasets and are not linked directly to biological agents. Thus, placing a virus into a taxonomic scheme solely from primary genome structure is an increasingly important problem. Various simple descriptive statistics of a viral genome sequence have been used successfully for virus classification. Here, we use the NCBI's viral and viroid reference sequence collection (RefSeq) and a common experimental framework to compare the performance of different genome sequence-derived features and classifiers in the task of assigning a virus to one of seven ICTV Orders. The nucleotide-, word-, and compression-based features we consider include genome length, the k-mer Natural Vector (k = 1, ..., 6) and its derivatives, return time distribution, and general-purpose and DNA-specific compression ratios; the classifiers used are the k-NN and SVM. The combination of genome length and k-NN has the worst, yet still respectable, performance (mean error rate of 0.137); the best performance is achieved using 4-mer counts and SVM (mean error rate of 0.006). We investigate the main causes of misclassification, explore which viruses are more difficult to classify, and use the best performing combination to predict the Orders of 1,834 unclassified viruses. A subsequent version of RefSeq assigned Orders to 17 of these previously unlabelled viruses. Since 16 of our predictions match these assignments, our approach could aid virologists dealing with viruses that are known only from sequence data.

연구 동기 및 목표

  • 메타게놈 분석에서 유도된 생물학적 맥락이 없는 바이러스 게놈만으로도 분류하는 데 증가하는 도전에 대응하기 위해.
  • 바이러스 게놈 분류에 대해 정렬 무관 특징—염기 기반, 단어 기반(k-mer), 압축 기반—의 성능을 평가하기 위해.
  • 바이러스를 ICTV 주문에 할당하기 위한 최적의 특징 및 분류기 조합을 규명하기 위해.
  • 1,834개의 분류되지 않은 바이러스 게놈의 ICTV 주문을 예측하고, 후속 RefSeq 업데이트와의 일치 여부를 검증하기 위해.

제안 방법

  • 연구는 바이러스 및 비바이러스 게놈을 기반으로 한 NCBI RefSeq 바이러스 및 비바이러스 기준 데이터셋을 사용하여, 일곱 개인 ICTV 주문으로 바이러스를 분류하기 위한 학습 및 평가 데이터로 활용한다.
  • 세 가지 유형의 특징을 추출한다: 염기 기반(게놈 길이, k=1에서 6까지의 k-mer 자연벡터), 단어 기반(k-mer의 재방문 시간 분포), 압축 기반(일반 목적 및 DNA 전용 압축 비율).
  • 성능 평가를 위해 k-NN 및 라디얼 기저 함수 커널을 사용한 SVM을 분류기로 활용하여 다양한 특징 세트에서의 성능을 분석한다.
  • 가장 뛰어난 성능을 보인 모델—4-mer 카운트를 사용한 SVM—을 활용해 이전에 분류되지 않은 1,834개의 바이러스 게놈에 대한 주문을 예측한다.
  • 10중 교차검증을 통한 평균 오류율을 사용하여 성능을 평가하고, 잘못 분류된 바이러스를 식별하기 위해 오류 분석 및 시각화를 실시한다.
  • 미분류된 게놈과 희박한 생물학적 레이블을 활용하여 분류 성능을 향상시키기 위한 향후 확장으로 그래프 기반의 준지도 학습 프레임워크를 제안한다.

실험 결과

연구 질문

  • RQ1바이러스 게놈을 ICTV 주문에 할당할 때, 어떤 게놈 유도 특징과 분류기 조합이 가장 높은 정확도를 보이는가?
  • RQ2오분류의 주요 원인은 무엇이며, 시퀀스 전용 특징을 사용할 때 어떤 바이러스 군집이 가장 분류가 어려운가?
  • RQ3이러한 방법이 생물학적 특성 정보가 없는, 단지 게놈 서열로만 알려진 바이러스의 ICTV 주문을 얼마나 정확하게 예측할 수 있는가?
  • RQ4모델의 예측은 RefSeq 데이터베이스의 후속 업데이트와 일치하는가?
  • RQ5미분류된 게놈과 희박한 생물학적 레이블을 활용하는 그래프 기반 준지도 학습이 분류 성능을 향상시킬 수 있는가?

주요 결과

  • 4-mer 카운트와 SVM의 조합가 가장 뛰어난 성능을 보이며 평균 오류율이 0.006에 불과하여, 다른 모든 특징-분류기 조합보다 뚜렷하게 뛰어나다.
  • 가장 성능이 열악한 방법—게놈 길이와 k-NN 조합—조차도 평균 오류율 0.137을 기록하여, 심지어 단순한 특징조차도 분류에 기여할 수 있음을 시사한다.
  • 특정 분류되지 않은 또는 매우 다형성이 높은 바이러스군은 서열 복잡성이나 기준 분류군과의 유사도 부족으로 인해 더 분류가 어려운 것으로 규명되었다.
  • 최고의 모델을 사용해 예측한 1,834개의 분류되지 않은 바이러스 중 16개는 후속 RefSeq 업데이트에서 동일한 ICTV 주문으로 할당되었으며, 이는 모델의 예측 능력을 검증한 것이다.
  • 결과적으로, 시퀀스 기반 분류는 생물학적 데이터가 없을 경우 메타게놈 데이터에서 바이러스의 분류를 신뢰하고 확장 가능한 방법으로 활용할 수 있음을 시사한다.
  • 저자들은 그래프 기반 준지도 학습이 미분류된 게놈과 희박한 생물학적 주석을 동적이고 데이터 기반의 분류 체계에 통합함으로써 분류 성능을 추가로 향상시킬 수 있을 것이라고 제안한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.