QUICK REVIEW
[論文レビュー] Want Drugs? Use Python
Michał Nowotka, George Papadatos|arXiv (Cornell University)|Jul 1, 2016
Computational Drug Discovery Methods参考文献 3被引用数 4
ひとこと要約
この論文は、ChEMBLにおけるドラッグディスcoveryデータのキュレート、分析、共有を簡素化するためのPythonの中心的役割を示している。著者たちは、RDKit、Django、Beaker、ウェブサービスといったPythonベースのツールを活用し、化学情報学的タスク、ターゲット予測、データ配布のためのスケーラブルでオープンソースのパイプラインを構築した。これにより、計算的ドラッグディスcoveryにおける効率的で再現可能で共同作業可能な科学的ワークフローが実現された。
ABSTRACT
We describe how Python can be leveraged to streamline the curation, modelling and dissemination of drug discovery data as well as the development of innovative, freely available tools for the related scientific community. We look at various examples, such as chemistry toolkits, machine-learning applications and web frameworks and show how Python can glue it all together to create efficient data science pipelines.
研究の動機と目的
- Pythonベースのツールを用いて、ドラッグディスcoveryデータのキュレート、モデリング、配布を簡素化すること。
- 計算的ドラッグディスcoveryにおける化学データセットの処理・分析のための効率的で統合されたパイプラインの不足に対処すること。
- ローカルインストールを必要としない、再利用可能でオープンソースのツールを開発し、研究者が化学情報学的タスクを実行できるようにすること。
- ウェブサービスと標準化されたデータフォーマット(例:JSON、XML、YAML)を通じて、データへのアクセス性を向上させること。
- Pythonライブラリを用いて構築されたオープンで再現可能なワークフローを用いて、ドラッグターゲットの予測モデリングを支援すること。
提案手法
- OracleからMySQLおよびPostgreSQLへのデータエクスポートにDjango ORMを活用し、データベース間の相互運用性と自動的なスキーマ変換を実現した。
- RDKitの機能をHTTP経由で公開するRESTful APIを備えたBeakerプロジェクト(PythonのBottleフレームワークで構築)を採用し、ローカルインストールの必要性を排除した。
- Django、Tastypie、Gunicornを用いてウェブサービスをデプロイし、JSON、XML、YAML、CORSをサポートすることで、クライント側からのAJAXによるアクセスを可能にした。
- RDKitを統合し、分子記述子の計算、サブストラクチャ検索および類似性検索、SMILES/InChIフォーマット変換を実行した。
- scikit-learnとpandasを用いて、キュレート済みChEMBLデータを用いてナイーブベイズモデルを構築・学習し、ターゲット予測を実施した。
- Celeryをタスクキューとして活用し、データキュレート中の化学計算を管理することで、計算処理とユーザーインターフェースを分離した。
実験結果
リサーチクエスチョン
- RQ1Pythonを用いて、処理および配布のためのスケーラブルで再利用可能かつオープンソースのパイプラインを構築する方法は何か?
- RQ2Pythonベースのウェブサービスを化学情報学ワークロードに用いる際の技術的およびアーキテクチャ的利点は何か?
- RQ3RESTful APIは、ローカルソフトウェアのインストールを必要とせずに、複雑な化学情報学的処理(例:サブストラクチャ検索、記述子計算)を公開できるか?
- RQ4科学的文献からの化学データのハイパフォーマンスキュレートを、Pythonベースのワークフローがどの程度効果的に支援できるか?
- RQ5Pythonエコシステムを用いて、オープンで再現可能な機械学習モデルを構築・共有する際の可能性はどの程度か?
主な発見
- ChEMBLチームは、複数のデータベース形式とデータ交換標準をサポートするSQLダンプおよびウェブサービスを含む、完全なスタックベースのPythonインfraストラクチャを成功裏に展開した。
- Beakerプロジェクトにより、HTTPアクセス可能なシステムがREST APIを介してRDKitの化学情報学的機能にリモートアクセスでき、ローカルインストールが不要となった。
- ChEMBLウェブサービスは、高度なフィルタリング、ページネーション、およびJSONPやYAMLを含む複数の出力フォーマットをサポートする18の異なるエンドポイントを公開している。
- キュレート済みChEMBLデータを用いて学習したナイーブベイズモデルにより、既知のドラッグ化合物のターゲット予測が可能となり、モデルとチュートリアルはダウンロード・再利用が可能である。
- Celeryを用いた非同期化学計算により、データ処理とユーザー操作の分離が実現され、キュレートの効率が向上した。
- ウェブサービス、Beaker、クライントライブラリを含むこのスタック全体は、Apache 2.0ライセンスで公開され、GitHubおよびPyPIにホスティングされており、迅速なデプロイとコミュニティ貢献が可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。