[论文解读] How to out-perform default random forest regression: choosing hyperparameters for applications in large-sample hydrology
本研究针对大规模水文中的随机森林与XGBoost回归模型,识别出优化的超参数,显著优于默认设置。基于151个全球流域数据集和元学习,提供了数据驱动的默认超参数,提升了预测精度——尤其在KGE和NSE指标上,使无需专家调参知识的水文学家也能轻松使用先进机器学习技术。
Predictions are a central part of water resources research. Historically, physically-based models have been preferred; however, they have largely failed at modeling hydrological processes at a catchment scale and there are some important prediction problems that cannot be modeled physically. As such, machine learning (ML) models have been seen as a valid alternative in recent years. In spite of their availability, well-optimized state-of-the-art ML strategies are not being widely used in water resources research. This is because using state-of-the-art ML models and optimizing hyperparameters requires expert mathematical and statistical knowledge. Further, some analyses require many model trainings, so sometimes even expert statisticians cannot properly optimize hyperparameters. To leverage data and use it effectively to drive scientific advances in the field, it is essential to make ML models accessible to subject matter experts by improving automated machine learning resources. ML models such as XGBoost have been recently shown to outperform random forest (RF) models which are traditionally used in water resources research. In this study, based on over 150 water-related datasets, we extensively compare XGBoost and RF. This study provides water scientists with access to quick user-friendly RF and XGBoost model optimization.
研究动机与目标
- 解决在水文回归中广泛使用默认超参数的问题,尽管其性能次优。
- 克服超参数优化(HPO)所需专家知识的障碍,从而推动水文学中先进机器学习的采用。
- 基于151个大规模水文数据集,训练一个元模型,根据元特征预测新数据集的最优超参数。
- 系统比较XGBoost与随机森林在不同评估指标(KGE与NSE)和HPO策略下的性能表现。
- 提供实用、用户友好且基于数据的超参数默认值,其在真实水文应用中优于标准配置。
提出的方法
- 从CAMELS及相关基准数据集中收集并处理了151个大规模水文数据集,涵盖多样的气候与水文条件。
- 对XGBoost与随机森林模型,在定义的超参数空间内采用随机搜索进行系统性超参数优化。
- 使用KGE与NSE作为主要评估指标,评估所有数据集与超参数配置下的模型性能。
- 从每个数据集中提取元特征(如预测变量数量、数据范围、偏度等),用于训练元学习器,以预测新数据集的最优超参数。
- 利用数据集元特征与最优超参数配置之间的关系,训练元模型,以实现对未见流域的泛化能力。
- 通过在所有数据集上进行交叉验证,验证新超参数默认值相较于默认设置及先前最优默认值的性能表现。
实验结果
研究问题
- RQ1在大规模水文研究中,超参数优化能否显著提升随机森林与XGBoost模型的预测性能?
- RQ2当使用KGE与NSE指标评估时,XGBoost与随机森林的最优超参数有何差异?
- RQ3基于数据集元特征训练的元学习器,能否可靠预测新、未见水文流域的最优超参数?
- RQ4本研究识别出的最优超参数是否在不同水文条件与数据特征下,始终优于默认设置?
- RQ5在水文回归中,哪些超参数对提升模型性能影响最大?它们如何随评估指标变化?
主要发现
- 以KGE为评估指标的随机森林最优默认超参数为:mtry=0.885,numtrees=780,replace=True,min_node_size=0.14,sample_fraction=0.900,显著优于默认设置。
- 以NSE为评估指标时,随机森林的最优默认超参数为:mtry=0.650,numtrees=49,replace=False,min_nodesize=0.37,sample_fraction=0.854,表明最优设置在不同指标下存在显著差异。
- 当KGE为评估指标时,XGBoost优于随机森林,其最优超参数包括:numrounds=2945,eta=0.018,subsample=0.483。
- 对于NSE指标,XGBoost的最优设置为:numrounds=4942,eta=0.029,subsample=0.765,max_depth=6,lambda=1019.458,表明其采用更高正则化与更深的树结构,优于默认配置。
- 本研究提出的两种模型最优默认值均显著优于Probst等人(2019)的原始默认值,尤其在mtry、树的数量与采样比例方面,均高于先前推荐值。
- XGBoost在所有情况下均比随机森林更快,但慢于ranger实现;新超参数设置显著提升了各类流域类型下的预测精度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。