Skip to main content
QUICK REVIEW

[論文レビュー] Genome Sequence Classification for Animal Diagnostics with Graph Representations and Deep Neural Networks

Sai Narayanan, Akhilesh Ramachandran|arXiv (Cornell University)|Jul 24, 2020
Genomics and Phylogenetic Studies参考文献 41被引用数 5
ひとこと要約

本稿では、k-merを用いたDe Bruijnグラフとネットワーク埋め込み技術を活用し、牛のメタゲノム配列における病原体シグネチャーを分類するグラフベースのディープラーニングフレームワークを提案する。シミュレートされたデータセットにおいて、*Mannheimia hemolytica* の検出で最大89.7%の正確性を達成し、ベースラインのk-mer頻度法およびgraph2vec手法よりもそれぞれ26.2%および7.02%優れている。

ABSTRACT

Bovine Respiratory Disease Complex (BRDC) is a complex respiratory disease in cattle with multiple etiologies, including bacterial and viral. It is estimated that mortality, morbidity, therapy, and quarantine resulting from BRDC account for significant losses in the cattle industry. Early detection and management of BRDC are crucial in mitigating economic losses. Current animal disease diagnostics is based on traditional tests such as bacterial culture, serolog, and Polymerase Chain Reaction (PCR) tests. Even though these tests are validated for several diseases, their main challenge is their limited ability to detect the presence of multiple pathogens simultaneously. Advancements of data analytics and machine learning and applications over metagenome sequencing are setting trends on several applications. In this work, we demonstrate a machine learning approach to identify pathogen signatures present in bovine metagenome sequences using k-mer-based network embedding followed by a deep learning-based classification task. With experiments conducted on two different simulated datasets, we show that networks-based machine learning approaches can detect pathogen signature with up to 89.7% accuracy. We will make the data available publicly upon request to tackle this important problem in a difficult domain.

研究の動機と目的

  • 動物疾病診断における従来のPCRおよび培養法の限界、すなわち標的特異的でかつマルチプレックス化が困難である点を是正すること。
  • 病原体特異的プライマーの事前知識が不要な、スケーラブルで機械学習駆動の単一病原体感染の検出手法を構築すること。
  • グラフ表現学習とディープニューラルネットワークの有効性を、牛のメタゲノムにおける病原体と宿主ゲノム配列を区別する能力に関して評価すること。
  • De Bruijnグラフを構築するためのサブシーケンス長(k)およびマルチタスク学習の影響が、病原体分類のモデル性能に与える影響を調査すること。
  • 不均衡で現実世界のメタゲノムデータに特化した複数病原体検出が可能な将来のエンドツーエンドシステムの基盤を築くこと。

提案手法

  • メタゲノム配列のk-mer表現からDe Bruijnグラフを構築し、構造的でグラフベースのゲノム表現を生成する。
  • ノード2ベクトル、最短経路グラフカーネル(SPK)、グラフレットスキャンキングカーネル(GSK)を含む複数のネットワーク埋め込み技術を適用し、グラフの低次元ベクトル表現を生成する。
  • 自己符号化器に類似したデコーダーを介して入力配列の再構築を同時に最適化するマルチタスク学習の目的関数を用いて、ディープニューラルネットワーク分類器を訓練する。
  • 制御された条件下でモデル性能を評価するために、バランスの取れた宿主および病原体配列を有するシミュレートデータセット(DS500およびDS5000)を用いる。
  • 標準的な分類評価指標(正確性、F1スコアなど)を用いて、生のk-mer頻度法およびgraph2vec埋め込みを含むベースライン手法と性能を比較する。
  • k-mer長(k)およびマルチタスク学習およびデコーダー部の有無がモデル正確性に与える影響を評価するためのアブレーションスタディを実施する。

実験結果

リサーチクエスチョン

  • RQ1従来のk-mer頻度法と比較して、メタゲノム配列のグラフベース表現が病原体分類の正確性を向上させることができるか?
  • RQ2ノード2ベクトル、SPK、GSKなどの異なるネットワーク埋め込み技術は、牛のメタゲノムにおける病原体と宿主配列をどの程度効果的に区別できるか?
  • RQ3再構築目的関数を組み込んだマルチタスク学習は、特に小規模データセットにおいて一般化性能を向上させ、過学習を低減するか?
  • RQ4De Bruijnグラフを構築するためのk-mer長(k)の変化に、モデル性能はどの程度感受的か?
  • RQ5デコーダーネットワークおよびマルチタスク学習の導入が、分類性能にどの程度向上効果をもたらすか?

主な発見

  • グラフ埋め込みを用いた提案されたディープラーニングモデルは、DS5000データセットで最大89.7%の正確性を達成し、ベースラインのk-mer頻度法を著しく上回った。
  • DS500データセットにおいて、k-mer頻度ベースラインより26.2%、graph2vecより7.02%の正確性向上を達成し、グラフベース表現の有効性を示した。
  • 最短経路グラフカーネル(SPK)埋め込みは、異なるk値および分類器タイプにおいて一貫した性能を示したが、ノード2ベクトルはkの増加に対してより感受的であり、DS500においてkを2から6に増加させた際、正確性が約17%低下した。
  • 分類と再構築の両目的を同時に最適化するマルチタスク学習により、DS500では平均で6.65%、DS5000では5.77%の正確性向上が見られ、一般化性能の向上と過学習の低減が示された。
  • デコーダーネットワークを削除すると、DS500で平均8.43%、DS5000で7.64%の正確性低下が生じ、マルチタスクフレームワークにおける再構築目的の重要性が強調された。
  • グラフレットスキャンキングカーネル(GSK)は、異なる分類器およびk値においても高い耐性を示し、特徴表現の堅牢性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。