Skip to main content
QUICK REVIEW

[論文レビュー] Toward Scalable Machine Learning and Data Mining: the Bioinformatics Case

Faraz Faghri, Sayed Hadi Hashemi|arXiv (Cornell University)|Sep 29, 2017
Machine Learning in Bioinformatics参考文献 10被引用数 5
ひとこと要約

この論文は、分類、クラスタリング、回帰、グラフィカルモデル、次元削減を含む、バイオインフォマティクス分野における機械学習およびデータマイニングで最も影響力のあるアルゴリズムを特定・分析し、スケーラブルなコンピューティングの専門家が最適化の対象となるアルゴリズムを優先順位付けするのを支援する。広く使われ、高いインパクトを持つ手法に焦点を当てることで、計算生物学におけるビッグデータのスケーラブルなストレージおよび計算システムの設計において「一般的なケースを最適化する」原則を提唱する。

ABSTRACT

In an effort to overcome the data deluge in computational biology and bioinformatics and to facilitate bioinformatics research in the era of big data, we identify some of the most influential algorithms that have been widely used in the bioinformatics community. These top data mining and machine learning algorithms cover classification, clustering, regression, graphical model-based learning, and dimensionality reduction. The goal of this study is to guide the focus of scalable computing experts in the endeavor of applying new storage and scalable computation designs to bioinformatics algorithms that merit their attention most, following the engineering maxim of "optimize the common case".

研究の動機と目的

  • 計算生物学およびバイオインフォマティクス分野におけるデータの洪水に対処し、最も影響力のある機械学習およびデータマイニングアルゴリズムを特定すること。
  • バイオインフォマティクス分野での実際の使用状況と影響力を根拠に、スケーラブルなコンピューティングの専門家がアルゴリズムの最適化対象を優先順位づけるのを支援すること。
  • 分類、クラスタリング、回帰、グラフィカルモデル、次元削減の分野で広く採用されているアルゴリズムに焦点を当て、『一般的なケースを最適化する』工学的原則を適用すること。
  • バイオインフォマティクスの研究ニーズとスケーラブルなハイパフォーマンスコンピューティングインfra構築の設計の間のギャップを埋めること。

提案手法

  • バイオインフォマティクス研究で使用されている優れた性能を示す機械学習およびデータマイニングアルゴリズムを体系的に調査・分類すること。
  • 遺伝子発現解析、配列分類、経路モデリングなど、複数のバイオインフォマティクス応用分野で広く採用されているアルゴリズムに焦点を当てる。
  • 計算複雑性、並列処理可能性、I/O パターンといったアルゴリズム的特性を分析し、スケーラブルなシステムに適した適合性を評価すること。
  • 最も頻繁に使用されているアルゴリズムを最適化することで、バイオインフォマティクスコミュニティ全体におけるパフォーマンス向上の最大化が可能であることを強調すること。
  • 使用頻度、計算強度、および新しいストレージおよび並列コンピューティング設計による加速の可能性に基づいて、アルゴリズムの最適化対象を優先順位づけるフレームワークを提言すること。

実験結果

リサーチクエスチョン

  • RQ1バイオインフォマティクス研究で最も広く使われ、影響力のある機械学習およびデータマイニングアルゴリズムは何か?
  • RQ2スケーラブルなコンピューティングの専門家は、バイオインフォマティクス応用におけるパフォーマンス向上を最大化するために、どのようにアルゴリズムの最適化対象を優先順位づけることができるか?
  • RQ3分散および並列システムにおける最適化に適した、主要なバイオインフォマティクスアルゴリズムの計算的特性は何か?
  • RQ4『一般的なケースを最適化する』原則を、バイオインフォマティクスのためのスケーラブルなストレージおよび計算システム設計に効果的に適用するにはどうすればよいか?
  • RQ5生物学におけるビッグデータの文脈において、将来のスケーラブルなシステム開発に最も有望なアルゴリズムのカテゴリーは何か?

主な発見

  • 本研究では、分類、クラスタリング、回帰、グラフィカルモデルに基づく学習、次元削減が、バイオインフォマティクスで最も頻繁に使用されるコアなアルゴリズムのカテゴリーであると特定した。
  • これらの主要なアルゴリズムは、ゲノム研究、トランスクリプトーム研究、およびシステム生物学分野における計算ワークロードの大部分を占めている。
  • 著者らは、こうした一般的に使用されているアルゴリズムを最適化することで、スケーラブルなシステム設計における投資対効果が最大限に高まることを示した。
  • 本論文は、反復的計算、スパースデータ処理、I/O集約的処理といったアルゴリズム的パターンが、特定された手法の間で広く共通していることを強調した。
  • 今後のスケーラブルなインfraストラクチャは、こうした支配的ワークロードを念頭に置いて設計されるべきであると示唆している。これにより、パフォーマンスおよび効率の向上が最大限に達成される。
  • 本研究は、システム設計者が、実際のバイオインフォマティクス研究コミュニティのニーズに合わせてハードウェアおよびソフトウェアの最適化を調整するためのロードマップを提供している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。