[論文レビュー] DeepCCI: End-to-end Deep Learning for Chemical-Chemical Interaction Prediction
DeepCCIは、生のSMILES文字列を入力として用い、共有1次元畳み込みニューラルネットワーク(CNN)を活用して階層的特徴を抽出し、可換性を保証するエンド・ツー・エンドのディープラーニングフレームワークを提案する。7つの指標において、従来の手法(ディープ分類器や従来の機械学習モデル)を上回り、特徴工学を不要にした上で、CCI予測の精度と頑健性に優れている。
Chemical-chemical interaction (CCI) plays a key role in predicting candidate drugs, toxicity, therapeutic effects, and biological functions. In various types of chemical analyses, computational approaches are often required due to the amount of data that needs to be handled. The recent remarkable growth and outstanding performance of deep learning have attracted considerable research attention. However,even in state-of-the-art drug analysis methods, deep learning continues to be used only as a classifier, although deep learning is capable of not only simple classification but also automated feature extraction. In this paper, we propose the first end-to-end learning method for CCI, named DeepCCI. Hidden features are derived from a simplified molecular input line entry system (SMILES), which is a string notation representing the chemical structure, instead of learning from crafted features. To discover hidden representations for the SMILES strings, we use convolutional neural networks (CNNs). To guarantee the commutative property for homogeneous interaction, we apply model sharing and hidden representation merging techniques. The performance of DeepCCI was compared with a plain deep classifier and conventional machine learning methods. The proposed DeepCCI showed the best performance in all seven evaluation metrics used. In addition, the commutative property was experimentally validated. The automatically extracted features through end-to-end SMILES learning alleviates the significant efforts required for manual feature engineering. It is expected to improve prediction performance, in drug analyses.
研究の動機と目的
- 手動による特徴工学を回避するエンド・ツー・エンドのディープラーニング手法を開発すること。
- 生のSMILES文字列を入力として、ディープニューラルネットワークを用いて自動的かつ階層的な特徴抽出を実現すること。
- CCI予測において可換性を強制し、(A,B)と(B,A)の間で対称的な相互作用確率を保証すること。
- 手作業で作成された分子フィンガープrint(例:PubChem)と比較して、エンド・ツー・エンドのSMILES学習が優れていることを検証すること。
- 他の化学およびドラッグディスcoveryタスクに応用可能なスケーラブルで一般化可能なフレームワークを提供すること。
提案手法
- 手作業による分子記述子を避けて、生のSMILES文字列を入力として使用する。
- SMILESシーケンスから深く階層的な表現を抽出するために、共有1次元CNNを採用する。
- 2つの入力化学物質間でモデルを共有することで、対称性を確保し、可換性を保証する。
- 両方の化学物質の隠れ表現を要素ごとの平均化または連結によって統合する。
- 統合された表現に基づいて相互作用確率を予測する最終的な分類器ヘッドを用いる。
- SMILES文字にワンホットエンコーディングを適用し、シーケンスの長さを統一するためにゼロパディングを実施する。
実験結果
リサーチクエスチョン
- RQ1生のSMILES文字列に対するエンド・ツー・エンドのディープラーニングは、従来の手法を上回る性能を示せるか?
- RQ2共有CNNアーキテクチャは、CCI予測において可換性を効果的に強制できるか?
- RQ3CNNによって自動抽出された特徴は、PubChemフィンガープrintなど手作業で作成されたフィンガープリントと比較して、どのように性能を発揮するか?
- RQ4手動による特徴工学を一切行わずに、多様な化学的相互作用に一般化できるか?
- RQ5アーキテクチャ設計の選択(例:モデル共有、表現統合)が、予測精度および対称性に与える影響は何か?
主な発見
- DeepCCIは、7つの評価指標すべてで最高のパフォーマンスを達成し、シンプルなディープ分類器や従来の機械学習モデルを上回った。
- モデルは(A,B)と(B,A)ペアについて、訓練精度とテスト精度が同一であったため、可換性が実験的に裏付けられた。
- ベースラインモデル(例:FFNN、SVM、RF、AdaBoost)では、入力順序を入れ替えた際の性能低下が10%〜21%に及んでおり、対称性を満たしていないことが確認された。
- CNNを用いたSMILESからの自動抽出特徴が、PubChemフィンガープリントを上回る性能を示し、より関連性が高く複雑なパターンを発見できたことが示唆された。
- 共有CNNと表現統合の活用により、相互作用の対称性が的確に維持された。これは、同種の相互作用タスクにおいて極めて重要であることが証明された。
- エンド・ツー・エンドで自動的特徴学習が可能な点を踏まえ、QSAR、毒性学、ドラッグターゲット予測など、より広範な応用分野への応用可能性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。