Skip to main content
QUICK REVIEW

[论文解读] Light Gradient Boosting Machine as a Regression Method for Quantitative Structure-Activity Relationships

Robert P. Sheridan, Andy Liaw|arXiv (Cornell University)|Apr 28, 2021
Computational Drug Discovery Methods参考文献 19被引用 14
一句话总结

本文评估了轻量梯度提升机(LightGBM)作为定量构效关系(QSAR)建模中回归方法的性能,表明其预测精度与深度神经网络相当,同时比随机森林快达1,000倍,比XGBoost快4倍。LightGBM还原生支持预测区间估计,提升了其在药物QSAR应用中的实用性。

ABSTRACT

In the pharmaceutical industry, where it is common to generate many QSAR models with large numbers of molecules and descriptors, the best QSAR methods are those that can generate the most accurate predictions but that are also insensitive to hyperparameters and are computationally efficient. Here we compare Light Gradient Boosting Machine (LightGBM) to random forest, single-task deep neural nets, and Extreme Gradient Boosting (XGBoost) on 30 in-house data sets. While any boosting algorithm has many adjustable hyperparameters, we can define a set of standard hyperparameters at which LightGBM makes predictions about as accurate as single-task deep neural nets, but is a factor of 1000-fold faster than random forest and ~4-fold faster than XGBoost in terms of total computational time for the largest models. Another very useful feature of LightGBM is that it includes a native method for estimating prediction intervals.

研究动机与目标

  • 评估LightGBM作为药物研究中可扩展且准确的回归方法在QSAR建模中的表现。
  • 在多种QSAR数据集上,将LightGBM的性能与随机森林、XGBoost和单任务深度神经网络进行比较。
  • 评估LightGBM在大规模QSAR建模中计算效率和超参数敏感性的表现。
  • 研究LightGBM在回归任务中对预测区间估计的原生能力。
  • 确定LightGBM是否在精度、速度和鲁棒性之间提供了工业级QSAR工作流程的实用平衡。

提出的方法

  • 将LightGBM作为梯度提升决策树集成模型,用于从分子描述符预测活性值。
  • 采用叶节点优先的树生长策略,以提高训练效率并减少过拟合。
  • 使用标准配置对超参数进行调优,以确保与XGBoost、随机森林和深度神经网络的公平比较。
  • 利用分位数回归在LightGBM内部原生估计预测区间,实现不确定性量化。
  • 通过RMSE和R²等标准回归指标,在30个内部QSAR数据集上评估模型性能。
  • 测量并比较所有模型的计算时间,以评估相对效率。

实验结果

研究问题

  • RQ1在QSAR建模中,LightGBM的预测精度与随机森林、XGBoost和深度神经网络相比如何?
  • RQ2在大规模QSAR数据集上,LightGBM相对于随机森林和XGBoost的计算效率如何?
  • RQ3LightGBM在具有不同描述符数量和分子数量的多样化QSAR数据集中是否保持稳健性能?
  • RQ4LightGBM是否无需额外校准即可原生估计可靠的预测区间?
  • RQ5与其它提升方法或神经网络方法相比,LightGBM对超参数调优的敏感性是否更低?

主要发现

  • 在全部30个QSAR数据集中,LightGBM的预测精度与单任务深度神经网络相当。
  • 在最大规模模型中,LightGBM的总计算时间约为随机森林的1/1,000,约为XGBoost的1/4。
  • 在使用标准配置时,LightGBM对超参数调优表现出较低的敏感性,增强了可复现性。
  • LightGBM原生支持预测区间估计,无需外部校准即可提供不确定性量化。
  • LightGBM在速度上优于XGBoost,同时保持相似或更优的预测性能。
  • 该方法在高通量QSAR建模中表现出高度可扩展性和有效性,适用于药物研发应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。