Skip to main content
QUICK REVIEW

[論文レビュー] MoleHD: Drug Discovery using Brain-Inspired Hyperdimensional Computing.

Dongning Ma, Rahul Thapa|arXiv (Cornell University)|Sep 20, 2021
Ferroelectric and Negative Capacitance Devices参考文献 28被引用数 6
ひとこと要約

MoleHDは、分子性状予測のための脳にインspiredされたハイパーサイディメンショナルコンピューティング(HDC)アプローチを提案する。SMILES文字列を高次元ベクトルに符号化することで、効率的な学習と推論を可能にする。Clintox、BBBP、SIDERデータセットにおける29の分類タスクにおいて、SOTAのROC-AUC性能を達成—ランダム分割およびスケルトン分割では最高、ストラティファイド分割では2番目に高いスコア—を記録。SOTAのグラフおよび再帰的ニューラルネットワークと比較して、計算コストと学習作業が顕著に低減されている。

ABSTRACT

Modern drug discovery is often time-consuming, complex and cost-ineffective due to the large volume of molecular data and complicated molecular properties. Recently, machine learning algorithms have shown promising results in virtual screening of automated drug discovery by predicting molecular properties. While emerging learning methods such as graph neural networks and recurrent neural networks exhibit high accuracy, they are also notoriously computation-intensive and memory-intensive with operations such as feature embeddings or deep convolutions. In this paper, we propose a viable alternative to existing learning methods by presenting \model, a method based on brain-inspired hyperdimensional computing (HDC) for molecular property prediction. We develop HDC encoders to project SMILES representation of a molecule into high-dimensional vectors that are used for HDC training and inference. We perform an extensive evaluation using 29 classification tasks from 3 widely-used molecule datasets (Clintox, BBBP, SIDER) under three splits methods (random, scaffold, and stratified). By an comprehensive comparison with 8 existing learning models including SOTA graph/recurrent neural networks, we show that MoleHD is able to achieve highest ROC-AUC score on random and scaffold splits on average across 3 datasets and achieve second-highest on stratified split. Importantly, MoleHD achieves such performance with significantly reduced computing cost and training efforts. To the best of our knowledge, this is the first HDC-based method for drug discovery. The promising results presented in this paper can potentially lead to a novel path in drug discovery research.

研究の動機と目的

  • 既存の深層学習モデルがドラッグディスカバリにおいて高い計算およびメモリ要件を課しているという問題に対処すること。
  • グラフおよび再帰的ニューラルネットワークの代替手段として、ハイパーサイディメンショナルコンピューティング(HDC)が分子性状予測において新たな効率的アプローチとして実現可能かどうかを検討すること。
  • バーチャルスクリーニングにおける予測性能を維持または向上させつつ、学習時間とリソース消費を削減すること。
  • 標準的な分子データセット上で、異なるデータ分割(ランダム、スケルトン、ストラティファイド)における本手法のロバストネスを評価すること。
  • 最初のHDCベースのフレームワークとしてのドラッグディスカバリを確立し、深層学習の代替手段としてのスケーラビリティと効率性の可能性を示すこと。

提案手法

  • MoleHDはHDCエンコーダーを用いて、分子のSMILES表現を構造的・化学的情報を保持した高次元バイナリーベクトルに変換する。
  • 従来のニューラルネットワークで見られる、深層畳み込みや特徴埋め込みといった高コストな演算を回避するため、学習および推論にハイパーサイディメンショナルベクトルを用いる。
  • 符号化されたベクトルから分子性状の表現を学習するために、ベクトル加算やバインディングといった標準的なHDC演算を適用する。
  • モデルは、Clintox、BBBP、SIDERの3つのベンチマークデータセットから得た29の分類タスクで学習および評価される。
  • 一般化性能とロバストネスを評価するために、ランダム、スケルトン、ストラティファイドの3つのデータ分割戦略が用いられる。
  • ROC-AUCを主な指標として用い、8つの既存モデル(SOTAのグラフおよび再帰的ニューラルネットワークを含む)と性能を比較評価する。

実験結果

リサーチクエスチョン

  • RQ1ハイパーサイディメンショナルコンピューティングは、ドラッグディスカバリにおける分子性状予測に効果的に適用可能か?
  • RQ2MoleHDの性能は、異なるデータ分割におけるROC-AUCスコアに関して、SOTAの深層学習モデルと比較してどうなるか?
  • RQ3従来の深層学習アプローチと比較して、MoleHDは計算コストおよび学習コストをどの程度低減できるか?
  • RQ4スケルトン分割およびストラティファイド分割を含む、さまざまなデータ分割戦略においてもMoleHDは強力な性能を維持できるか?
  • RQ5HDCは、ドラッグディスカバリにおけるバーチャルスクリーニングのための実用的でスケーラブルな代替手段として成立するか?

主な発見

  • MoleHDは、Clintox、BBBP、SIDERの3つのデータセットにおいて、ランダム分割およびスケルトン分割で平均ROC-AUCスコアが最高を記録した。
  • ストラティファイド分割では、平均ROC-AUCスコアが2番目に高く、多様なデータ分布にわたる強力な一般化性能を示した。
  • SOTAのグラフおよび再帰的ニューラルネットワークを含む、既存の深層学習モデルと比較して、計算コストと学習作業が顕著に低減された。
  • 性能向上は、3つのすべてのデータセットで一貫しており、異なる分子性状タイプおよびデータ特性に対してロバストであることが示された。
  • MoleHDは、ドラッグディスカバリにハイパーサイディメンショナルコンピューティングを応用した最初の知られているアプリケーションであり、分子性状予測のための新規で効率的な道筋を確立した。
  • 結果から、HDCベースの手法は、はるかに低いリソース要件で競争力のある性能を発揮できることを示唆しており、より高速かつスケーラブルなバーチャルスクリーニングを可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。