Skip to main content
QUICK REVIEW

[論文レビュー] AGATHA: Automatic Graph-mining And Transformer based Hypothesis generation Approach

Justin Sybrandt, Ilya Tyagin|arXiv (Cornell University)|Feb 13, 2020
Computational Drug Discovery Methods被引用数 5
ひとこと要約

AGATHA は、生物医学文献から文単位の NLP 技術を用いて大規模な意味的グラフを構築し、学習された表現を用いて埋め込みを行い、トランスフォーマーに基づくモデルで新しい研究的関連性のための妥当な語群のペアをランク付けする、深層学習を用いた仮説生成システムである。2015 年のベンチマークで AUC 0.901 の最先端の性能を達成し、多様なサブドメインへの一般化能力が顕著である。

ABSTRACT

Medical research is risky and expensive. Drug discovery, as an example, requires that researchers efficiently winnow thousands of potential targets to a small candidate set for more thorough evaluation. However, research groups spend significant time and money to perform the experiments necessary to determine this candidate set long before seeing intermediate results. Hypothesis generation systems address this challenge by mining the wealth of publicly available scientific information to predict plausible research directions. We present AGATHA, a deep-learning hypothesis generation system that can introduce data-driven insights earlier in the discovery process. Through a learned ranking criteria, this system quickly prioritizes plausible term-pairs among entity sets, allowing us to recommend new research directions. We massively validate our system with a temporal holdout wherein we predict connections first introduced after 2015 using data published beforehand. We additionally explore biomedical sub-domains, and demonstrate AGATHA's predictive capacity across the twenty most popular relationship types. This system achieves best-in-class performance on an established benchmark, and demonstrates high recommendation scores across subdomains. Reproducibility: All code, experimental data, and pre-trained models are available online: sybrandt.com/2020/agatha

研究の動機と目的

  • 指数的に増加する文献の前進を考慮し、生物学的発見の加速を図る挑戦に応えるために、仮説生成を自動化すること。
  • ヒューリスティックなランク付けや手動の監視、限定的な範囲に依存する従来のシステムの限界を克服し、スケーラブルでデータ駆動型の発見を可能にすること。
  • 最小限の人的介入で、高品質でクロスドメインの研究的仮説を大規模に生成できるシステムを開発すること。
  • 数百件のクエリ/秒の高速かつ高スループットの照会を可能にし、多数対多数の仮説推薦を実現すること。
  • 多様な生物学的サブドメイン、特に希少で複雑な関係性を含む、ベンチマークデータセットで優れた性能を発揮するとともに、一般化能力を示すこと。

提案手法

  • 生物医学テキストからの文単位の埋め込みを用いて、SciBERT および ScispaCy を活用し、ドメイン特化された NLP を実行することで、意味的で多層的なグラフを構築する。
  • エンティティと関係性の間の意味的関係を捉える、学習された共有表現空間を用いてグラフを埋め込む。
  • グラフ内の文脈的および構造的近接性に基づき、語群ペアの関連性の妥当性を予測するため、トランスフォーマーのエンコーダー・モデルを訓練する。
  • 従来の研究で用いられるヒューリスティックなランク付け基準を、教師あり学習によりエンドツーエンド微分可能な学習されたランク付け関数に置き換える。
  • 時系列ホールアウトバリデーション戦略を採用し、2015年1月1日以前のデータで学習し、その後に導入された関連性でテストする。
  • 20の生物学的サブドメインにモデルを適用し、標準ベンチマークを用いて多様な関係性タイプで性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1大規模で文単位の意味的グラフを学習した深層学習モデルは、ヒューリスティックベースのシステムを上回り、新しい生物学的関連性を予測できるか?
  • RQ2単一で統一されたモデルが、多様な生物学的サブドメインおよび関係性タイプにどの程度一般化できるか?
  • RQ3学習されたランク付け基準は、ルールベースまたはパスベースの手法と比較して、妥当でかつ未発見の関連性を同定するのにどの程度効果的か?
  • RQ4時系列ホールアウトベンチマークにおいて、AGATHA は 2015 年以降に導入された関連性を、2015 年以前のデータのみを用いて予測できるか?予測の有効性を検証できるか?
  • RQ5トランスフォーマーに基づくアーキテクチャの使用は、GrEDeL や Moliere といった従来のモデルと比較して、一般化能力およびランク付け品質を向上させるか?

主な発見

  • AGATHA は 2015 年のベンチマークで AUC 0.901 を達成し、従来の最先端の 0.718 より顕著な向上を示した。
  • 20 個の一般的な生物学的関係性タイプにわたり、強い性能を示しており、広範なサブドメインへの一般化能力が裏付けられた。
  • 時系列ホールアウトバリデーションにより、2015 年以降に導入された関連性を、2015 年以前のデータのみを用いて予測できることを確認し、予測能力の妥当性が裏付けられた。
  • モデルにより、GPU 上で数百件のクエリ/秒の高スループット照会が可能となり、多数対多数の仮説推薦が現実的になった。
  • 学習されたランク付け基準は、ヒューリスティックベースの手法を上回り、人的監視への依存を低減し、発見の効率を向上させた。
  • システムはオープンソースであり、公開されており、事前学習済みモデルとコードを含む。2015 年のバリデーション用システムに加え、最新の 2019 年版もリリースされた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。