Skip to main content
QUICK REVIEW

[論文レビュー] MoleHD: Automated Drug Discovery using Brain-Inspired Hyperdimensional Computing.

Dongning Ma, Xun Jiao|arXiv (Cornell University)|Jun 5, 2021
Ferroelectric and Negative Capacitance Devices参考文献 19被引用数 4
ひとこと要約

MoleHDは、SMILES文字列をSMILE-PEトークナイゼーションとHDC符号化を用いて高次元ベクトルに変換することで、神経科学にインspiredされたハイパーサイズコンピューティング(HDC)アプローチを提案する。30の分類タスクにおいて、6つの最先端のニューラルネットワークも含む10のベースライン手法を上回り、計算コストを著しく削減した。これは、創薬分野におけるHDCベースの手法の初の成功例である。

ABSTRACT

Modern drug discovery is often time-consuming, complex and cost-ineffective due to the large volume of molecular data and complicated molecular properties. Recently, machine learning algorithms have shown promising results in virtual screening of automated drug discovery by predicting molecular properties. While emerging learning methods such as graph neural networks and recurrent neural networks exhibit high accuracy, they are also notoriously computation-intensive and memory-intensive with operations such as feature embeddings or deep convolutions. In this paper, we propose a viable alternative to neural network classifiers. We present MoleHD, a method based on brain-inspired hyperdimensional computing (HDC) for molecular property prediction. We first transform the SMILES presentation of molecules into feature vectors by SMILE-PE tokenizers pretrained on the ChEMBL database. Then, we develop HDC encoders to project such features into high-dimensional vectors that are used for training and inference. We perform an extensive evaluation using 30 classification tasks from 3 widely-used molecule datasets and compare MoleHD with 10 baseline methods including 6 SOTA neural network classifiers. Results show that MoleHD is able to outperform all the baseline methods on average across 30 classification tasks with significantly reduced computing cost. To the best of our knowledge, we develop the first HDC-based method for drug discovery. The promising results presented in this paper can potentially lead to a novel path in drug discovery research.

研究の動機と目的

  • 分子性質予測における深層学習モデルの高い計算およびメモリ要件を解決すること。
  • 創薬分野におけるニューラルネットワークの代替手段として、低コストな脳にインspiredされたハイパーサイズコンピューティングを検討すること。
  • 分子の高次元ベクトル表現を用いた、スケーラブルで効率的なバーチャルスクリーニング手法の開発。
  • HDCベースのモデルが、低い推論および学習コストで最先端の性能を達成できることを実証すること。

提案手法

  • ChEMBLデータベースで事前学習されたトークナイザーであるSMILE-PEを用いて、分子のSMILES文字列をトークン化表現に変換する。
  • 独自開発のHDCエンコーダーを用いて、トークン化された特徴量を高次元バイナリーベクトルに符号化する。
  • 得られた高次元ベクトルを分類タスクにおける学習および推論の入力として使用する。
  • 予測のために、HDC符号化されたベクトルに対してシンプルな分類器(例:コサイン類似度、多数決投票)を適用する。
  • HDCが持つ本質的な耐障害性およびスパarsityを活かし、計算の効率化とノイズ耐性を実現する。
  • 3つの標準データセットから得た30の多様な分子分類タスクでモデルを訓練および評価する。

実験結果

リサーチクエスチョン

  • RQ1ハイパーサイズコンピューティングは、顕著に低い計算コストで、深層学習モデルを分子性質予測タスクで上回ることができるか?
  • RQ2多様な分子分類ベンチマークにおいて、HDCベースのモデルの性能は最先端のニューラルネットワークと比べてどの程度か?
  • RQ3SMILE-PEトークナイザーとHDC符号化を組み合わせることで、分子の意味的特徴が下流の予測タスクにどの程度保持されるか?
  • RQ4化学的空間の複雑さが異なる多様な分子データセットにおいて、HDCベースのモデルは一般化できるか?

主な発見

  • MoleHDは、30の分子分類タスクの平均で、6つの最先端のニューラルネットワーク分類器も含む10のベースライン手法をすべて上回った。
  • 深層学習モデルと比較して、顕著に低い計算およびメモリ要件で、優れたまたは競争力のある性能を達成した。
  • SMILE-PEトークナイゼーションの使用により、SMILES文字列からの有効な特徴抽出が可能となり、HDC符号化の強固な基盤が構築された。
  • MoleHDは多様なデータセットにわたって強力な一般化性能を示し、HDC表現の高い転送可能性を裏付けた。
  • 結果から、ハイパーサイズコンピューティングが創薬プロセスにおける深層学習の代替手段として実用的で効率的であることが裏付けられた。
  • 本研究は、HDCを分子性質予測に成功した初の応用であり、自動創薬分野における新たな道を切り開いた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。