Skip to main content
QUICK REVIEW

[論文レビュー] Industry-Scale Orchestrated Federated Learning for Drug Discovery

Martijn Oldenhof, Gergely Ács|arXiv (Cornell University)|Oct 17, 2022
Computational Drug Discovery Methods被引用数 10
ひとこと要約

本論文は、IMI MELLODDYプロジェクト内での開発により、10の製薬会社が機密データを共有せずに共同でグローバルなドラッグディスcoveryモデルを訓練できる業界規模のフェデレーテッドラーニングプラットフォームを提示する。AWS上で暗号技術を用いて安全にモデル勾配を集約することで、すべての提携パートナーにおいてAUC-PRで4%、活性予測で2%、適用分野範囲で10%の性能向上を達成した。これは、ドラッグディスcoveryにおけるスケーラブルでプライバシー保護型のAIの有効性を示している。

ABSTRACT

To apply federated learning to drug discovery we developed a novel platform in the context of European Innovative Medicines Initiative (IMI) project MELLODDY (grant n°831472), which was comprised of 10 pharmaceutical companies, academic research labs, large industrial companies and startups. The MELLODDY platform was the first industry-scale platform to enable the creation of a global federated model for drug discovery without sharing the confidential data sets of the individual partners. The federated model was trained on the platform by aggregating the gradients of all contributing partners in a cryptographic, secure way following each training iteration. The platform was deployed on an Amazon Web Services (AWS) multi-account architecture running Kubernetes clusters in private subnets. Organisationally, the roles of the different partners were codified as different rights and permissions on the platform and administrated in a decentralized way. The MELLODDY platform generated new scientific discoveries which are described in a companion paper.

研究の動機と目的

  • ドラッグディスカバリの高い失敗率とR&Dコストを低減するため、共同学習によってモデル性能を向上させること。
  • 製薬業界において、特許情報やアッセイデータを共有しないというデータの機密性と機密保持の障壁を克服すること。
  • 中央集権的なデータ集約なしに、クロスインダストリーの協働を可能にするスケーラブルで安全かつプロダクション運用可能なフェデレーテッドラーニングインfraを構築すること。
  • フェデレーテッドラーニングが実際の産業環境において、QSARモデルの予測精度と適用分野範囲を向上させられることを実証すること。
  • ドラッグディスカバリのような機微な分野における多者間協働を支える分散型でアクセス制御可能なガバナンスモデルを確立すること。

提案手法

  • プライベートサブネットにKubernetesクラスタを配置したマルチアカウントAWSアーキテクチャを導入し、フェデレーテッドラーニングプラットフォームをホスティングした。
  • 暗号的手法を用いた安全な勾配集約プロトコルを実装し、生データを露呈せずにモデル更新を共有することを保証した。
  • 細粒度のアクセス権限を用いて組織の役割とアクセス権限を明文化し、10の提携パートナー間で分散型の管理を可能にした。
  • 中央サーバーにはc5n.18xlargeインスタンス、クライアントワーカーにはr5n.2xlargeインスタンスを用いて、通信およびメモリのボトル neck を管理した。
  • 収束性とスケーラビリティを最適化するため、20エポック、1ラウンドあたり50〜80のミニバッチを用いたフェデレーテッドアベレージを適用した。
  • モデルの不確実性を定量化し、適用分野範囲の拡張度(デルタメジアンコンフォーマルエフィシェンシー)を測定するために、コンフォーマル予測を採用した。

実験結果

リサーチクエスチョン

  • RQ1フェデレーテッドラーニングは、データ機密性を損なわず、複数産業・複数パートナーのドラッグディスカバリーレベルでのスケーリングが可能か?
  • RQ2フェデレーテッドラーニングは、単一パートナーのモデルと比較して、QSARモデリングにおける予測性能をどの程度向上させるか?
  • RQ3フェデレーテッドモデルは、個々のパートナーモデルと比較して、適用分野範囲をどの程度拡大するか?
  • RQ4大規模フェデレーテッドラーニングにおける主な計算ボトル neck(通信、メモリなど)は何か?
  • RQ5分散型ガバナンスおよびアクセス制御モデルは、機微な分野における長期的な産業協働を効果的に支援できるか?

主な発見

  • フェデレーテッドモデルは、10万件を超える機械学習タスクにおいて、単一パートナーモデルと比較してAUC-PRが平均で4%向上した。
  • デルタメジアンコンフォーマルエフィシェンシーとして測定したところ、適用分野範囲が10%向上し、新規の化学構造に対しても信頼性のある予測が可能になった。
  • 全パートナーにおいて、薬理学的および毒性活性の予測において回帰性能が2%向上した。
  • 特に、継続的なデータ収集が行われている吸収性・代謝・毒性アッセイにおいて、性能向上が顕著に見られた。
  • 20エポックおよび50〜80のミニバッチを用いた安定した学習が達成され、構成に応じて学習時間は1.7〜12.9時間の範囲で変動した。
  • 10の製薬会社全員が実用的利点を確認し、自社の内部ドラッグディスカバリープロセスにモデルを統合する意思を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。