Skip to main content
QUICK REVIEW

[論文レビュー] Uncertainty quantification of molecular property prediction with Bayesian neural networks

Seongok Ryu, Yongchan Kwon|arXiv (Cornell University)|Mar 20, 2019
Machine Learning in Materials Science参考文献 16被引用数 15
ひとこと要約

本稿では、分子特性予測における予測不確実性を定量化するため、ベイジアングラフ畳み込みネットワーク(ベイジアンGCN)を提案する。予測不確実性をデータ駆動型(アレアトリック)とモデル駆動型(エピステミック)の成分に分解する。不確実性が予測の信頼性と強く相関することを示し、予測の信頼性の高いスクリーニングとデータエラーの検出が可能になる。特にハーバードクリーンエネルギー・プロジェクトのような合成データセットにおいて顕著であり、分子AIアプリケーションにおけるAIの安全性を向上させる。

ABSTRACT

Deep neural networks have outperformed existing machine learning models in various molecular applications. In practical applications, it is still difficult to make confident decisions because of the uncertainty in predictions arisen from insufficient quality and quantity of training data. Here, we show that Bayesian neural networks are useful to quantify the uncertainty of molecular property prediction with three numerical experiments. In particular, it enables us to decompose the predictive variance into the model- and data-driven uncertainties, which helps to elucidate the source of errors. In the logP predictions, we show that data noise affected the data-driven uncertainties more significantly than the model-driven ones. Based on this analysis, we were able to find unexpected errors in the Harvard Clean Energy Project dataset. Lastly, we show that the confidence of prediction is closely related to the predictive uncertainty by performing on bio-activity and toxicity classification problems.

研究の動機と目的

  • 実用的応用において、限られたおよびノイズの多い訓練データによる信頼性の低い分子特性予測の課題に対処すること。
  • 意思決定の信頼性を向上させるために、分子機械学習モデルにおける予測不確実性を定量化する手法を開発すること。
  • 分子予測におけるデータ駆動型(アレアトリック)とモデル駆動型(エピステミック)の不確実性要因を区別すること。
  • 予測不確実性がバイナリ分類タスク(バイオアクティビティおよびトキシシティ予測を含む)における信頼性の良い信頼度指標として機能することを検証すること。
  • 合成分子データセットにおける異常な不確実性パターンを分析することで、特に誤った合成アノテーションのようなデータ品質の問題を検出すること。

提案手法

  • 予測の確率的出力を提供し、分子特性回帰および分類における不確実性を定量化するために、ベイジアンニューラルネットワーク(BNNs)を採用する。
  • ネットワーク重みの事後分布を近似するために変分推論を用い、グラフニューラルネットワークにおける不確実性推定を可能にする。
  • ベイジアン推論を用いて、合計予測分散をアレアトリック(データノイズ)とエピステミック(モデル不確実性)の成分に分解する。
  • 分子表現学習のためのディープラーニングバックボーンとして、拡張されたグラフ畳み込みネットワーク(GCNs)を適用する。
  • SMILESで符号化された構造と特性ラベルを用いて、分子グラフ上でベイジアンGCNを訓練し、各予測に対して不確実性を定量化する。
  • 不確実性のしきい値を用いて予測をグループ化し、分類タスクにおける信頼度-正確度関係を評価する。

実験結果

リサーチクエスチョン

  • RQ1ベイジアンGCNは、分子特性予測において、予測不確実性をデータ駆動型とモデル駆動型の成分に効果的に分解できるか?
  • RQ2計算手法の不正確さに起因するデータノイズ(例:M06-2X関数の誤った近似)が、分子特性予測におけるアレアトリック不確実性に与える影響は何か?
  • RQ3アレアトリック不確実性の異常な高まりが、合成分子データセットにおける誤ったデータやうまく近似されていないデータを検出するためのシグナルとして機能するか?
  • RQ4バイナリ分類タスク(バイオアクティビティおよびトキシシティ予測を含む)において、予測不確実性は信頼度の信頼できる代理指標となるか?
  • RQ5低不確実性が、分子分類モデルにおける高い予測正確度とどの程度相関するか?

主な発見

  • logP予測におけるアレアトリック不確実性は、データノイズを追加するにつれて増加したが、エピステミック不確実性は比較的安定していた。これは、本手法がデータ関連の不確実性を的確に分離できることを確認した。
  • ハーバードクリーンエネルギー・プロジェクトデータセットにおいて、予測PCE値が正確にゼロであった分子は、異常に高いアレアトリック不確実性を示した。これは、M06-2X関数の不良な近似に起因する誤ったアノテーションであると後で確認された。
  • ベイジアンGCNは、PCE値がゼロの1,058個の分子を誤りである可能性が高いと特定し、不確実性がデータ品質管理に有用であることを示した。
  • バイオアクティビティおよびトキシシティ分類において、合計不確実性が低い分子は顕著に高い分類正確度を示した。特に、最も低い不確実性を示したグループ(最高の正確度)は、DUD-Eデータセットで92.3%の正確度を達成した。
  • 合計不確実性は、予測確率が0または1に近いところで最小化され、0.5に近いところで最大化された。これは、不確実性が有効な信頼度指標として機能することを確認した。
  • 分類タスクにおいて、アレアトリック不確実性がエピステミック不確実性よりも顕著に合計不確実性に寄与しており、この設定ではデータノイズが不確実性の主因であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。