Skip to main content
QUICK REVIEW

[論文レビュー] Artificial Intelligence in Drug Discovery: Applications and Techniques

Jianyuan Deng, Zhibo Yang|arXiv (Cornell University)|Jun 9, 2021
Computational Drug Discovery Methods参考文献 230被引用数 8
ひとこと要約

本サーベイは、小分子薬物発見における人工知能(AI)の応用について包括的な概要を提供し、分子性質予測と分子生成に焦点を当てている。データリソース、分子表現、ベンチマークプラットフォーム、モデルアーキテクチャ(例:GNN、トランスフォーマー)および学習パラダイム(教師あり学習、自己教師あり学習、強化学習)を体系的にレビューし、技術的進展の歴史的分析を提供するとともに、データ不足、モデルの解釈可能性、標準化された評価プロトコルの欠如といった課題を強調している。

ABSTRACT

Artificial intelligence (AI) has been transforming the practice of drug discovery in the past decade. Various AI techniques have been used in a wide range of applications, such as virtual screening and drug design. In this survey, we first give an overview on drug discovery and discuss related applications, which can be reduced to two major tasks, i.e., molecular property prediction and molecule generation. We then discuss common data resources, molecule representations and benchmark platforms. Furthermore, to summarize the progress of AI in drug discovery, we present the relevant AI techniques including model architectures and learning paradigms in the papers surveyed. We expect that this survey will serve as a guide for researchers who are interested in working at the interface of artificial intelligence and drug discovery. We also provide a GitHub repository (https://github.com/dengjianyuan/Survey_AI_Drug_Discovery) with the collection of papers and codes, if applicable, as a learning resource, which is regularly updated.

研究の動機と目的

  • 小分子薬物発見に応用されたAI技術を体系的にレビューすること。特に予測的および生成的タスクに焦点を当てる。
  • AI駆動の薬物発見に用いられる主要なデータリソース、分子表現、ベンチマークプラットフォームを特定・分析すること。
  • AIを用いた薬物発見におけるモデルアーキテクチャおよび学習パララダイムの進化を検討すること。伝統的な機械学習から深層学習、自己教師あり手法へと至る。
  • データ不足、モデルの解釈可能性、標準化された評価プロトコルの欠如といった継続的な課題を強調すること。
  • 関連論文およびコードを定期的に更新するGitHubリポジトリを維持することで、学習リソースとしての役割を果たすこと。

提案手法

  • 薬物発見におけるAI応用を、分子性質予測と分子生成の2つのコアタスクに分類すること。
  • 既存のデータセット(例:PubChem、ZINC)をサーベイし、整理し、学習およびベンチマークに向けた有用性を評価すること。
  • SMILES、フィンガープrint(例:ECFP)、グラフベースの符号化(例:GNN)などの分子表現をレビューすること。
  • CNN、RNN、グラフニューラルネットワーク(GNN)、トランスフォーマーなどのモデルアーキテクチャを、分子モデリングの文脈で分析すること。
  • 教師あり学習、自己教師あり事前学習、強化学習などの学習パラダイムを、薬物設計の文脈で検討すること。
  • 関連論文およびコードを収集したGitHubリポジトリを提供することで、分野における継続的な研究および教育を支援すること。

実験結果

リサーチクエスチョン

  • RQ1過去10年間で、AI技術は分子性質予測および分子生成への応用においてどのように進化してきたか?
  • RQ2AI駆動の薬物発見において、最も広く使われているデータリソース、分子表現、ベンチマークプラットフォームは何か?
  • RQ3異なるモデルアーキテクチャ(例:GNN、トランスフォーマー)および学習パラダイム(例:自己教師あり学習)は、性能および適用性においてどのように比較されるか?
  • RQ4データ品質、モデルの解釈可能性、評価の標準化に関する課題が、AIの実世界への導入を妨げる主な要因であるが、その主な障壁は何か?
  • RQ5実世界のデータ(例:EHR、DrugBank)は、AI駆動の薬物設計における仮説生成をどのように支援し、改善できるか?

主な発見

  • 深層学習の台頭にもかかわらず、ECFPのような固定フィンガープリントは、一部の分子性質予測タスクにおいてGNN由来の表現を上回っている。
  • 自己教師あり学習および強化学習のパラダイムは、化学空間のより効率的な探索を可能にするため、分子生成の分野でますます広く使われるようになっている。
  • データ不足とクラス不均衡は依然として深刻な課題であり、多くのベンチマークデータセットは1アッセイあたりのデータポイントが限られており、代表性に疑問が呈される場合がある。
  • モデルの解釈可能性は依然として主要な制限要因であり、透明性、根拠の提示、情報の豊かさ、不確実性推定を支援する説明可能なAIの需要が高まっている。
  • 研究間で標準化されたプロトコルが欠如しており、データ分割の不一致、評価指標(例:AUPRC 対 AUROC)、ハイパーパramータチューニング手順の不一致が見られる。
  • 電子歴史記録やDrugBankなどの実世界のデータソースは、仮説生成および薬物設計のインサイト向上に向けた貴重なツールとして登場しつつある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。