[论文解读] Industry-Scale Orchestrated Federated Learning for Drug Discovery
本论文介绍了在IMI MELLODDY项目内开发的工业规模联邦学习平台,使10家制药公司能够在不共享敏感数据的情况下协作训练全球药物发现模型。通过在AWS上使用密码学方法安全聚合模型梯度,该平台在AUC-PR上提升了4%,在活性预测上提升了2%,在所有合作方的适用域范围上提升了10%,展示了可扩展的、保护隐私的药物发现人工智能解决方案。
To apply federated learning to drug discovery we developed a novel platform in the context of European Innovative Medicines Initiative (IMI) project MELLODDY (grant n°831472), which was comprised of 10 pharmaceutical companies, academic research labs, large industrial companies and startups. The MELLODDY platform was the first industry-scale platform to enable the creation of a global federated model for drug discovery without sharing the confidential data sets of the individual partners. The federated model was trained on the platform by aggregating the gradients of all contributing partners in a cryptographic, secure way following each training iteration. The platform was deployed on an Amazon Web Services (AWS) multi-account architecture running Kubernetes clusters in private subnets. Organisationally, the roles of the different partners were codified as different rights and permissions on the platform and administrated in a decentralized way. The MELLODDY platform generated new scientific discoveries which are described in a companion paper.
研究动机与目标
- 通过协作学习提升模型性能,以应对药物发现中高失败率和高研发成本的问题。
- 克服制药行业中因公司不愿共享专有化合物和实验数据而造成的隐私与保密障碍。
- 开发一个可扩展、安全且可投入生产的联邦学习基础设施,实现在无集中式数据汇集情况下的跨行业协作。
- 证明联邦学习可在真实工业环境中提升QSAR模型的预测准确性和适用域范围。
- 在药物发现等敏感领域建立去中心化、权限化的治理模式,以支持多伙伴协作。
提出的方法
- 在AWS上采用多账户架构,于私有子网中部署Kubernetes集群以托管联邦学习平台。
- 实施安全的密码学梯度聚合协议,确保模型更新在不暴露原始数据的情况下共享。
- 通过细粒度权限编码组织角色与访问权限,实现10家合作方之间的去中心化管理。
- 为中央服务器使用c5n.18xlarge实例,为客户工作节点使用r5n.2xlarge实例,以应对通信与内存瓶颈。
- 采用联邦平均算法,训练20个周期,每轮使用50至80个小型批量,以优化收敛性与可扩展性。
- 采用归纳预测方法量化模型不确定性,并通过“中位数偏差的归纳效率”(delta median conformal efficiency)衡量适用域扩展程度。
实验结果
研究问题
- RQ1联邦学习是否能在不损害数据保密性的前提下,扩展至多行业、多合作方的药物研发场景?
- RQ2与单一合作方模型相比,联邦学习在QSAR建模中能多大程度上提升预测性能?
- RQ3与各合作方独立模型相比,联邦模型在适用域范围上扩展了多少?
- RQ4在大规模药物发现联邦学习中,关键计算瓶颈(如通信、内存)是什么?
- RQ5去中心化的治理与访问控制模型是否能有效支持敏感领域中的长期工业协作?
主要发现
- 与单一合作方模型相比,联邦模型在超过10万个机器学习任务中平均提升了4%的AUC-PR。
- 适用域范围扩展了10%,以“中位数偏差的归纳效率”(delta median conformal efficiency)衡量,使对新型化学结构的预测更具信心。
- 所有合作方在预测药理学与毒性活性方面,回归性能平均提升了2%。
- 性能提升在药代动力学和毒性检测中最为显著,尤其是那些仍在持续获取数据的检测。
- 平台在20个训练周期和50至80个小型批量下实现了稳定训练,训练时间根据配置在1.7至12.9小时内不等。
- 所有10家制药公司均确认了实际收益,并表达了将模型集成至其内部药物发现流程的意愿。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。