Skip to main content
QUICK REVIEW

[論文レビュー] Deep learning in bioinformatics: introduction, application, and perspective in big data era

Yu Li, Chao Huang|arXiv (Cornell University)|Feb 28, 2019
Machine Learning in Bioinformatics参考文献 198被引用数 4
ひとこと要約

本レビューでは、バイオインフォマティクスにおけるディープラーニングを紹介し、CNN、RNN、GNN、GAN、VAEといった主要なアーキテクチャの理解しやすい概要を提供するとともに、5つのバイオインフォマティクス分野および4種類のデータタイプにおけるTensorFlow/Kerasベースの実装を実践的に提示する。過学習や解釈可能性の課題にも言及し、コードは公開済みであり、ディープラーニングがビッグデータ駆動の生物学的研究において不可欠であることを位置づけている。

ABSTRACT

Deep learning, which is especially formidable in handling big data, has achieved great success in various fields, including bioinformatics. With the advances of the big data era in biology, it is foreseeable that deep learning will become increasingly important in the field and will be incorporated in vast majorities of analysis pipelines. In this review, we provide both the exoteric introduction of deep learning, and concrete examples and implementations of its representative applications in bioinformatics. We start from the recent achievements of deep learning in the bioinformatics field, pointing out the problems which are suitable to use deep learning. After that, we introduce deep learning in an easy-to-understand fashion, from shallow neural networks to legendary convolutional neural networks, legendary recurrent neural networks, graph neural networks, generative adversarial networks, variational autoencoder, and the most recent state-of-the-art architectures. After that, we provide eight examples, covering five bioinformatics research directions and all the four kinds of data type, with the implementation written in Tensorflow and Keras. Finally, we discuss the common issues, such as overfitting and interpretability, that users will encounter when adopting deep learning methods and provide corresponding suggestions. The implementations are freely available at \url{https://github.com/lykaust15/Deep_learning_examples}.

研究の動機と目的

  • ニューラルネットワークに馴染みのないバイオインフォマティクス研究者に対して、ディープラーニングの包括的でアクセスしやすい紹介を提供すること。
  • 配列解析、構造予測、バイオ分子機能予測を含む、多様なバイオインフォマティクス分野における実用的なディープラーニング応用を示すこと。
  • 過学習、解釈可能性、計算リソースの要求といったディープラーニングの導入における一般的な課題に、実行可能な解決策を提示すること。
  • 8つの代表的なユースケースを対象に、TensorFlowおよびKerasを用いたオープンソースで再現可能な実装を提供し、手法の採用を加速させること。
  • 生物学的ビッグデータの複雑さとスケールの増大に対応するため、ディープラーニングを変容的ツールとして位置づけること。

提案手法

  • 浅いニューラルネットワークから始まり、CNN、RNN、そしてGANやVAEといった高度なアーキテクチャに至るまで、ディープラーニングの基礎を紹介する。
  • 段階的な教育的戦略を採用:基本的概念から最先端のモデルまでをカバーし、専門外の研究者にもアクセス可能であることを保証する。
  • 5つの研究分野にディープラーニング技術を適用:配列解析、構造予測、バイオ分子特性/機能予測、医療画像、システム生物学。
  • 提供された例では、ゲノム配列、構造データ、オミクスプロファイル、医療画像の4種類のデータタイプを用いる。
  • TensorFlowおよびKerasを用いてモデルを実装し、再現性とコミュニティによる再利用を可能にするためにGitHubにコードをホスティングする。
  • 計算コストとメモリ使用量を削減するためのモデル圧縮技術( pruning、知識蒸留、低ランク因子分解、コンパクトフィルタ)を提案する。

実験結果

リサーチクエスチョン

  • RQ1ゲノムバリアント予測やタンパク質構造モデリングといったバイオインフォマティクスの主要な問題を解消するために、どのディープラーニングアーキテクチャが最も効果的か?
  • RQ2小規模またはノイズの多い生物学的データセットにおいて、ディープラーニングモデルをより解釈可能かつ過学習に強くするにはどうすればよいか?
  • RQ3新しい生物学的データでモデルを更新する際、再学習を一切行わずに、継続的学習のための災難的忘却(catastrophic forgetting)を緩和するにはどのような戦略が有効か?
  • RQ4モデル圧縮技術は、リソース制限のある医療情報処理環境におけるディープラーニングのデプロイをどのように改善できるか?
  • RQ5既存のバイオインフォマティクスパイプラインにディープラーニングを統合するための実用的で実装可能なワークフローは何か?

主な発見

  • 特にCNNとRNNは、タンパク質二次構造予測、転写因子結合部位検出、DNAバリアント効果予測といったタスクで最先端の性能を達成している。
  • VAEやGANのような生成モデルは、複雑な生物学的配列をモデル化し、生物学的に妥当な合成データを生成する点で有望である。
  • グラフニューラルネットワーク(GNN)やメッセージパッシングアーキテクチャは、バイオ分子相互作用やシステムレベルの生物学的ネットワークを効果的にモデル化できる。
  • pruning や知識蒸留といったモデル圧縮技術は、モデルサイズと推論時間を顕著に削減し、エッジデバイスや臨床現場でのデプロイを可能にする。
  • ベイジアン推論(例:DLBI)とディープラーニングを統合することで、精度を損なわずに画像再構成を加速する超高解像度顕微鏡法の性能が向上する。
  • 著者らは、トランスファー学習と継続的学習戦略が、過去のデータに対する性能を維持しながら新しい生物学的知識に適応できるようになることを実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。