Skip to main content
QUICK REVIEW

[論文レビュー] Multimodal Deep Neural Networks using Both Engineered and Learned Representations for Biodegradability Prediction

Garrett B. Goh, Khushmeen Sakloth|arXiv (Cornell University)|Aug 13, 2018
Machine Learning and Data Classification参考文献 17被引用数 14
ひとこと要約

本論文では、2次元化学画像からの学習された表現と、設計された分子記述子(Ballabio-40 および PaDEL-1400)を組み合わせることで、生物学的分解性を予測する、新しいマルチモーダル CNN-MLP 神経ネットワークである DeepBioD を提案する。ドメイン特化の特徴工学と深層表現学習を統合することで、現在の最先端手法と比較して27%低い誤差率(0.125)を達成し、データが乏しい化学的応用においてハイブリッドアーキテクチャが単独モデルを上回ることを示している。

ABSTRACT

Deep learning algorithms excel at extracting patterns from raw data, and with large datasets, they have been very successful in computer vision and natural language applications. However, in other domains, large datasets on which to learn representations from may not exist. In this work, we develop a novel multimodal CNN-MLP neural network architecture that utilizes both domain-specific feature engineering as well as learned representations from raw data. We illustrate the effectiveness of such network designs in the chemical sciences, for predicting biodegradability. DeepBioD, a multimodal CNN-MLP network is more accurate than either standalone network designs, and achieves an error classification rate of 0.125 that is 27% lower than the current state-of-the-art. Thus, our work indicates that combining traditional feature engineering with representation learning can be effective, particularly in situations where labeled data is limited.

研究の動機と目的

  • 生物学的分解性を含む化学的性質予測におけるラベル付きデータの限界に取り組むこと。
  • エンジニアリングされた分子記述子と生の化学画像からの学習された表現を統合するマルチモーダルディープラーニングアーキテクチャを構築すること。
  • ラベル付きデータが少ないが、大規模なデータセットを有する化学的データセットにおいて、単独のディープラーニングまたは従来の機械学習モデルを上回る予測精度を向上させること。
  • ネットワークアーキテクチャ、ハイパーパramータ、および特徴選択がモデルの性能と一般化能力に与える影響を評価すること。
  • アンサンブル学習と信頼性フィルタリングの有効性を示し、モデルの頑健性とカバレッジを向上させること。

提案手法

  • 80×80ピクセルの化学画像(0.5 Å/ピクセルのグリッドと EngD カラーコーディング方式で生成)から階層的特徴を抽出するために、CNN(Chemception)を用いる。
  • エンジニアリングされた分子記述子(Ballabio-40:41 記述子、PaDEL-1400:約1400 記述子)は、別個の MLP ストリームで処理される。
  • CNN の最終中間層出力と MLP の最終層出力を連結し、分類用の最終全結合層に供給する。
  • 異なるランダムシードで独立して5つの DeepBioD モデルを訓練し、その予測を平均化することで、アンサンブルモデルを作成し、モデルの頑健性を向上させる。
  • DeepBioD+ モデルは、信頼性の低い予測(クラス確率 < 0.8)をフィルタリングするための信頼性しきい値を適用し、精度を向上させるが、カバレッジは低下する。
  • 弱い教師あり学習と転移学習を用いて、より大きな未ラベルデータセットで CNN を事前学習させ、データが少ない状況での一般化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1エンジニアリングされた分子記述子とディープラーニングで得た画像表現を組み合わせることで、データが乏しい化学的データセットにおける生物学的分解性予測の精度が向上するか?
  • RQ2画像と記述子のマルチモーダル入力の統合は、単モーダル手法と比較して、モデルの一般化能力と頑健性にどのような影響を与えるか?
  • RQ3アンサンブル学習と信頼性フィルタリングは、生物学的分解性予測におけるモデル性能と予測カバレッジにどのような影響を与えるか?
  • RQ4アーキテクチャの選択、ハイパーパramータ、および特徴選択は、マルチモーダルディープラーニングにおける化学分野の最終的なモデル精度と一般化能力にどのように影響を与えるか?
  • RQ5弱い教師あり学習による CNN の事前学習は、ラベル付きデータが限られている状況で性能を向上させることができるか?

主な発見

  • DeepBioD は分類誤差率 0.125 を達成し、現在の最先端のコンSENSUSモデル(0.170)と比較して27%低い誤差を示した。
  • 単一のネットワークで構成されるマルチモーダルモデル MM-S-ChemNet でさえ、すべての個別の従来の機械学習モデルとコンセンサス #1 モデルを上回り、誤差率 0.133 を達成した。
  • クラス確率 < 0.8 の予測をフィルタリングする修正版 DeepBioD+ モデルは、誤差率 0.090、予測カバレッジ 89% を達成し、コンセンサス #2 モデル(誤差率 0.130、カバレッジ 87%)と比較して31%の改善を示した。
  • アンサンブルアプローチは、複数回の訓練実行におけるモデルの安定性と一般化能力を顕著に向上させた。
  • より大きな未ラベルデータセットを用いた弱い教師あり学習による CNN の事前学習は、特徴学習を向上させ、生物学的分解性予測タスクにおける性能を向上させた。
  • 専門家が設計した分子記述子とディープラーニングで得た表現の統合は、エンジニアリング特徴または生データ表現に依存するモデルと比較して、優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。