[论文解读] Regression Enrichment Surfaces: a Simple Analysis Technique for Virtual Drug Screening Models
本文提出了回归富集曲面(RES),一种新颖的虚拟药物筛选模型可视化与评估技术,可直接评估预测排名在多大程度上恢复了排名靠前的活性化合物。通过绘制在前x%预测结果中捕获的真实命中化合物的比例,RES揭示了不同筛选阈值下模型的性能表现,表明当需要高精度、低通量的下游实验时,标准指标如$r^2$和EF可能具有误导性。
We present a new method for understanding the performance of a model in virtual drug screening tasks. While most virtual screening problems present as a mix between ranking and classification, the models are typically trained as regression models presenting a problem requiring either a choice of a cutoff or ranking measure. Our method, regression enrichment surfaces (RES), is based on the goal of virtual screening: to detect as many of the top-performing treatments as possible. We outline history of virtual screening performance measures and the idea behind RES. We offer a python package and details on how to implement and interpret the results.
研究动机与目标
- 为解决标准回归指标(如$r^2$、MSE)在评估虚拟药物筛选模型时的局限性,这些指标无法反映实际下游应用需求。
- 克服分类指标(如AUC、EF)的不足,后者假设固定阈值,且未考虑实际中筛选阈值的可变性。
- 提供一种以可视化为导向的评估方法,使模型性能与实际药物发现流程中的应用场景(如为昂贵的实验室测试选择少量化合物)保持一致。
- 证明相比仅依赖EF或$r^2$等汇总统计量,RES图能更有效地比较模型排名。
- 提供一种实用的、开源的Python实现,用于在虚拟筛选中可重现地评估机器学习模型。
提出的方法
- RES构建一个二维曲面,其中x轴表示模型预测排名中位于前x%的化合物比例,y轴表示在该排名子集中捕获的真实活性化合物的比例。
- 该方法将预测得分归一化至[0,1]区间,并计算在排名列表每个分位数处捕获的真实命中化合物的累积比例。
- RES得分定义为曲面在单位正方形上的积分,完美表现得分为1.0,随机排序得分为0.0。
- 该技术使用活性化合物与非活性化合物预测得分的实证累积分布函数(ECDF),以计算每个分位数处的命中恢复率。
- RES图通过在排名列表中以固定间隔(如每1%)采样,并计算在前k%预测中发现的真实命中化合物比例生成。
- 该方法可通过叠加多个模型的RES曲线或计算成对差异,实现对不同模型在不同筛选阈值下性能的直接比较。
实验结果
研究问题
- RQ1如何评估机器学习模型在虚拟药物筛选中的表现,使其能反映实际下游应用中的约束条件,如预算有限或通量受限?
- RQ2为何标准回归指标(如$r^2$和MSE)在目标为特定筛选阈值下实现命中恢复时,无法捕捉模型性能的有意义差异?
- RQ3当期望的命中集大小未知或高度选择性时,分类指标(如富集因子EF和AUC)在多大程度上会误导模型选择?
- RQ4与仅依赖汇总统计量相比,基于可视化的方法(如RES)是否能更清晰地揭示不同筛选阈值下模型之间的性能权衡?
- RQ5RES曲线的形状在多大程度上揭示了模型在高精度场景(如前0.1%)与更广泛筛选场景(如前10%)下的行为差异?
主要发现
- 尽管模型C的$r^2$和EF得分最高,但在捕获前10%真实命中化合物方面表现最差——RES显示其仅捕获了90%的前导命中,而模型A和B则捕获了100%。
- RES图清晰表明,模型C在超高压精度场景(如前0.1%)中优于其他模型,其曲线在此区域弯曲更急剧,表明其对最顶尖化合物的检测能力更强。
- 模型D的RES得分为0.8470,略低于模型C的0.8586,但RES显示模型D在各阈值下保持更平坦、更一致的命中恢复曲线,表明其具有更好的鲁棒性。
- 通过RES图相减(图2)比较模型差异时,模型C在0.01–0.03范围(前1–3%预测)表现更优,而模型B在0.1–0.3范围(前10–30%预测)表现更佳。
- 本研究证明,仅依赖$r^2$、EF或AUC可能导致模型选择失误——RES揭示了在表格化指标中不可见的关键性能差异。
- RES方法成功识别出模型A虽具有最高AUC(0.709),但在较高阈值下的命中恢复能力仍逊于模型B,这一细微差别仅在RES可视化中可见。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。