QUICK REVIEW
[论文解读] Want Drugs? Use Python
Michał Nowotka, George Papadatos|arXiv (Cornell University)|Jul 1, 2016
Computational Drug Discovery Methods参考文献 3被引用 4
一句话总结
本文展示了 Python 如何作为核心技术栈,用于简化 ChEMBL 在药物发现数据整理、分析和分发方面的流程。通过利用基于 Python 的工具(如 RDKit、Django、Beaker 和 Web 服务),作者构建了可扩展的开源数据处理流水线,用于化学信息学任务、靶点预测和数据分发,从而在计算药物发现中实现高效、可复现且协作化的科学工作流。
ABSTRACT
We describe how Python can be leveraged to streamline the curation, modelling and dissemination of drug discovery data as well as the development of innovative, freely available tools for the related scientific community. We look at various examples, such as chemistry toolkits, machine-learning applications and web frameworks and show how Python can glue it all together to create efficient data science pipelines.
研究动机与目标
- 利用基于 Python 的工具,简化药物发现数据的整理、建模和分发。
- 解决计算药物发现中缺乏高效、集成化数据处理与分析流水线的问题。
- 开发可重用的开源工具,使研究人员无需本地安装即可执行化学信息学任务。
- 通过 Web 服务和标准化数据格式(例如 JSON、XML、YAML)提升数据可及性。
- 利用 Python 库构建的开放、可复现的工作流,支持药物靶点的预测建模。
提出的方法
- 使用 Django ORM 将数据从 Oracle 导出至 MySQL 和 PostgreSQL,实现跨数据库兼容性,并自动完成模式转换。
- 采用 Beaker 项目——一个基于 Python(Bottle 框架)构建的 RESTful API——通过 HTTP 暴露 RDKit 功能,消除对本地安装的需求。
- 使用 Django、Tastypie 和 Gunicorn 部署 Web 服务,支持 JSON、XML、YAML 和 CORS,使客户端可通过 AJAX 访问。
- 集成 RDKit 以计算分子描述符、执行子结构搜索和相似性搜索,并实现 SMILES/InChI 格式转换。
- 使用 scikit-learn 和 pandas 基于整理后的 ChEMBL 数据构建并训练朴素贝叶斯模型,用于靶点预测。
- 使用 Celery 作为任务队列,管理数据整理过程中的化学计算,实现计算与用户界面的解耦。
实验结果
研究问题
- RQ1如何利用 Python 构建可扩展、可重用且开源的流水线,用于药物发现数据的处理与分发?
- RQ2基于 Python 的 Web 服务在化学信息学工作负载中具有哪些技术和架构优势?
- RQ3RESTful API 是否能够无需本地软件安装,即可暴露复杂化学信息学操作(如子结构搜索、描述符计算)?
- RQ4基于 Python 的工作流在从科学文献中高通量整理化学数据方面有多高效?
- RQ5在药物发现中,利用 Python 生态系统构建并共享开放、可复现的机器学习模型的潜力有多大?
主要发现
- ChEMBL 团队成功部署了一套完整的基于 Python 的基础设施,用于数据分发,包括 SQL 转储和 Web 服务,支持多种数据库格式和数据交换标准。
- Beaker 项目通过 REST API 实现了对 RDKit 化学信息学功能的远程访问,使任何具备 HTTP 访问权限的系统均可执行分子计算而无需本地安装。
- ChEMBL Web 服务暴露了 18 个不同的端点,支持高级过滤、分页以及多种输出格式,包括 JSONP 和 YAML。
- 基于 ChEMBL 数据训练的朴素贝叶斯模型可实现对已知药物化合物的靶点预测,相关模型和教程可供下载和重用。
- 使用 Celery 进行异步化学计算显著提升了数据整理效率,实现了数据处理与用户交互的解耦。
- 整个技术栈——包括 Web 服务、Beaker 和客户端库——采用 Apache 2.0 许可证,托管于 GitHub 和 PyPI,支持快速部署和社区贡献。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。