Skip to main content
QUICK REVIEW

[论文解读] Artificial Intelligence for In Silico Clinical Trials: A Review

Zifeng Wang, Chufan Gao|arXiv (Cornell University)|Sep 16, 2022
Statistical Methods in Clinical Trials被引用 9
一句话总结

本文综述了人工智能(AI)与机器学习(ML)在体外临床试验中的应用,重点关注临床模拟、个体化预测建模以及计算机辅助试验设计。文章提出了ML的建模范式、数据来源,并识别出关键挑战,如数据稀缺、分布外泛化能力不足以及低数据场景,同时强调联邦学习作为跨试验协作的有前景解决方案,可在不共享数据的前提下实现合作。

ABSTRACT

A clinical trial is an essential step in drug development, which is often costly and time-consuming. In silico trials are clinical trials conducted digitally through simulation and modeling as an alternative to traditional clinical trials. AI-enabled in silico trials can increase the case group size by creating virtual cohorts as controls. In addition, it also enables automation and optimization of trial design and predicts the trial success rate. This article systematically reviews papers under three main topics: clinical simulation, individualized predictive modeling, and computer-aided trial design. We focus on how machine learning (ML) may be applied in these applications. In particular, we present the machine learning problem formulation and available data sources for each task. We end with discussing the challenges and opportunities of AI for in silico trials in real-world applications.

研究动机与目标

  • 系统性回顾AI与ML在体外临床试验中三个核心领域的应用:临床模拟、个体化预测建模以及计算机辅助试验设计。
  • 识别并形式化每个任务的机器学习问题建模范式,包括数据表示与建模目标。
  • 整理与体外试验研究相关的可用数据源与基准,特别是针对试验入选标准与结局预测。
  • 突出关键挑战,如缺乏大规模数据集、分布外泛化能力不足以及临床试验中样本量小的场景。
  • 探索联邦学习作为跨组织模型训练的可行框架,同时保护数据隐私并应对数据异质性问题。

提出的方法

  • 将体外试验中AI应用划分为三大主题:临床模拟(如数字孪生)、个体化预测建模以及计算机辅助试验设计。
  • 为每项任务提出机器学习建模范式,例如通过条件生成模型(如条件受限玻尔兹曼机)建模队列水平结局,并利用Shapley值进行标准影响分析。
  • 以电子健康记录(EHRs)、电子数据采集(EDC)系统以及临床试验注册库(如ClinicalTrials.gov)为主要数据来源,用于模型训练与评估。
  • 应用聚类技术(如k-means)与可解释性方法(如Shapley得分)评估并优化试验入选标准,以提升队列规模与风险比结果。
  • 提出联邦学习作为在不共享原始数据的前提下跨多个临床试验训练模型的方法,以应对隐私与数据异质性挑战。
  • 回顾现有基准,如用于结局预测的TOP基准,并指出标准化数据集稀缺是主要限制。

实验结果

研究问题

  • RQ1机器学习如何用于为体外临床试验生成虚拟患者队列?
  • RQ2哪些机器学习技术可基于患者特异性数据实现对治疗结局的准确个体化预测?
  • RQ3AI如何通过评估入选标准对队列规模与结局指标的影响,优化临床试验设计?
  • RQ4支持AI驱动体外试验的关键数据源与模型建模范式是什么?
  • RQ5在部署AI用于体外试验时,主要挑战(如数据稀缺、分布外性能表现、小样本量泛化能力)是什么?

主要发现

  • 基于AI的体外临床试验可通过生成合成患者队列显著扩展虚拟对照组,从而在不增加真实世界招募的前提下提升统计效能。
  • 利用Shapley值与聚类的机器学习模型可定量评估单个入选标准对队列特征与风险比的影响,实现基于数据的方案优化。
  • 尽管已有进展,但仅有极小部分临床试验记录是公开的,且除TOP基准外,尚无大规模基准数据集用于结局预测。
  • 由于数据分布偏移,尤其在样本量有限的罕见病中,分布外泛化仍是主要挑战。
  • 联邦学习为跨试验模型训练提供了有前景的路径,可在不直接共享数据的前提下实现协作,但各试验间的数据异质性仍是重大障碍。
  • 迁移学习与模型适应是应对临床试验中常见低数据场景(尤其是I期与II期研究)的关键策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。