Skip to main content
QUICK REVIEW

[論文レビュー] Comparing Machine Learning Algorithms with or without Feature Extraction for DNA Classification

Xiangxie Zhang, Ben Beinke|arXiv (Cornell University)|Nov 1, 2020
Machine Learning in Bioinformatics参考文献 23被引用数 11
ひとこと要約

本稿では、生物学的に導かれたプライマーに依存せずにウイルスDNAを分類するため、DNA配列とランダムに生成されたDNAサブシーケンスとの間のLevenshtein距離を用いた新しい特徴抽出手法を提案する。4つのウイルス疾患データセットを用い、3-gram特徴抽出法およびディープラーニングモデル(CNN、DNN、N-gram)と比較した結果、最小のSARS-CoV-2データセット(97.26%の正確度)において、ランダムシーケンス法が他の手法を上回った。一方、より大きなデータセットでは3-gram法が全体として最高の正確度を達成した。

ABSTRACT

The classification of DNA sequences is a key research area in bioinformatics as it enables researchers to conduct genomic analysis and detect possible diseases. In this paper, three state-of-the-art algorithms, namely Convolutional Neural Networks, Deep Neural Networks, and N-gram Probabilistic Models, are used for the task of DNA classification. Furthermore, we introduce a novel feature extraction method based on the Levenshtein distance and randomly generated DNA sub-sequences to compute information-rich features from the DNA sequences. We also use an existing feature extraction method based on 3-grams to represent amino acids and combine both feature extraction methods with a multitude of machine learning algorithms. Four different data sets, each concerning viral diseases such as Covid-19, AIDS, Influenza, and Hepatitis C, are used for evaluating the different approaches. The results of the experiments show that all methods obtain high accuracies on the different DNA datasets. Furthermore, the domain-specific 3-gram feature extraction method leads in general to the best results in the experiments, while the newly proposed technique outperforms all other methods on the smallest Covid-19 dataset

研究の動機と目的

  • 従来の特徴抽出手法と新しい特徴抽出手法を用いた機械学習モデルのウイルスDNA配列分類性能を評価すること。
  • ランダムに生成されたDNA配列が、DNA分類における生物学的プライマーに代わる有効な特徴抽出手段として機能するかを検討すること。
  • 異なる特徴抽出手法と組み合わせたディープラーニングモデル(CNN、DNN、N-gram)と従来の機械学習モデル(SVM、Adaboost)の有効性を比較すること。
  • データセットサイズがモデル性能に与える影響、特に低データ環境下での影響を評価すること。
  • ドメイン特化の3-gram特徴と、提案されたランダムシーケンスベースの手法のどちらが、多様なウイルス疾患においてより優れた分類正確度を達成するかを特定すること。

提案手法

  • 入力DNA配列とランダムに生成されたDNAサブシーケンスの間のLevenshtein距離に基づく、情報豊富な特徴を計算する新しい特徴抽出手法を提案する。
  • DNA配列に含まれるすべての3ヌクレオチド組み合わせ(例:AAA、AACなど)を頻度ベースのベクトルに符号化するドメイン特化の3-gram特徴抽出手法を採用する。
  • 上記2つの特徴抽出手法を、SVM、Adaboost、CNN、DNN、N-gram確率モデルの複数の機械学習アルゴリズムと組み合わせる。
  • 実世界のウイルスDNAデータセット4つ(Hepatitis C、HIV(1型/2型)、インフルエンザ/コロナウイルス、SARS-CoV-2)を用い、異なるデータサイズとウイルス特性を反映する。
  • モデル評価には10-fold交差検証を適用し、繰り返し実験における平均正確度と標準偏差を報告する。
  • ランダムに生成されたDNAシーケンスの長さを変化させ、特徴抽出に最適な文字列長を特定するため、さまざまな長さでの性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1Levenshtein距離を用いたランダムDNAサブシーケンスベースの特徴抽出手法が、生物学的プライマーに代わる有効なDNA配列分類手法として機能するか。
  • RQ2異なるウイルスDNAデータセットにおいて、提案されたLevenshteinベース手法と確立された3-gram手法、およびディープラーニングモデル(CNN、DNN、N-gram)の性能はどのように比較されるか。
  • RQ3特にSARS-CoV-2のような小規模データセットにおいて、特徴抽出手法の性能はデータセットサイズの変化に著しく影響を受けるか。
  • RQ4各特徴抽出手法と組み合わせた場合、SVM、Adaboost、CNN、DNN、N-gramのうちどの機械学習アルゴリズムが最も高い正確度を達成するか。
  • RQ5Levenshteinベース特徴抽出に使用するランダムに生成されたDNAシーケンスの最適な長さは一貫して存在するか。

主な発見

  • 3-gram特徴抽出法とSVMまたはAdaboostを組み合わせた場合、Hepatitis Cデータセットで99.90% ± 0.32の平均正確度、インフルエンザ/コロナウイルスデータセットで99.99% ± 0.02の正確度を達成した。
  • 最小のSARS-CoV-2データセット(292サンプル)では、ランダムDNAシーケンスを用いたLevenshtein距離法が97.26% ± 3.34の正確度を達成し、2番目に良い手法(3-gram)を4.3ポイント上回った。
  • 3-gram法はより大きなデータセットにおいて一貫して優れた性能を示し、4つのデータセットのうち3つで99.7%を超えるほぼ完璧な正確度を達成した。
  • ディープラーニングモデル(CNNおよびDNN)は大きなデータセットでは高い正確度(98.50%~99.97%)を達成したが、最小のSARS-CoV-2データセットでは性能を発揮せず、DNNではたった90.12% ± 4.11にとどまった。
  • N-gram確率モデルは全データセットで高い正確度(99.10%~99.97%)を示し、シーケンスモデリングタスクにおける優れた性能を示した。
  • どの機械学習アルゴリズムも、すべてのデータセットおよび特徴抽出手法において一貫して優れた性能を発揮したわけではないが、SVMおよびAdaboostは3-gram法と最も競争力のある結果を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。