[论文解读] Computing AIC for black-box models using Generalised Degrees of Freedom: a comparison with cross-validation
本文研究使用广义自由度(GDF)计算黑箱机器学习模型的AIC,特别针对伯努利分布数据。尽管GDF在理论上是衡量模型复杂度的可靠指标,但本研究发现其计算成本高、不稳定,且对二值数据扰动的敏感性不一致,因此得出结论:在该类情境下,重复10折交叉验证在稳健性、效率和实用性方面更优。
Generalised Degrees of Freedom (GDF), as defined by Ye (1998 JASA 93:120-131), represent the sensitivity of model fits to perturbations of the data. As such they can be computed for any statistical model, making it possible, in principle, to derive the number of parameters in machine-learning approaches. Defined originally for normally distributed data only, we here investigate the potential of this approach for Bernoulli-data. GDF-values for models of simulated and real data are compared to model complexity-estimates from cross-validation. Similarly, we computed GDF-based AICc for randomForest, neural networks and boosted regression trees and demonstrated its similarity to cross-validation. GDF-estimates for binary data were unstable and inconsistently sensitive to the number of data points perturbed simultaneously, while at the same time being extremely computer-intensive in their calculation. Repeated 10-fold cross-validation was more robust, based on fewer assumptions and faster to compute. Our findings suggest that the GDF-approach does not readily transfer to Bernoulli data and a wider range of regression approaches.
研究动机与目标
- 通过使用广义自由度(GDF)作为模型复杂度的代理,将AIC扩展至非似然函数的机器学习模型。
- 评估基于GDF的AIC在伯努利分布数据上的稳定性、准确性和计算可行性,与交叉验证进行比较。
- 确定GDF是否可作为黑箱模型中模型选择与平均的交叉验证的可行替代方案。
- 评估GDF在各类模型(包括随机森林、神经网络和提升回归树)中的实用性。
- 比较基于GDF的AIC与基于交叉验证的偏差和模型复杂度估计,在稳健性和计算成本方面的表现。
提出的方法
- 通过估计拟合值对观测响应变化的敏感性,对单个数据点进行扰动,利用公式 GDF = trace(H) = Σ ∂ŷ_i / ∂y_i 计算GDF。
- 通过同时扰动多个观测点并评估模型响应,将GDF适配于伯努利数据,尽管此类设置下已知存在不稳定性。
- 将基于GDF的AICc与通过重复10折交叉验证获得的AIC进行比较,使用模拟和真实生态数据集。
- 使用交叉验证通过全模型与留出集之间对数似然差值(Δℓ^CV_m)来估计模型复杂度,作为基准。
- 通过统计GDF所需模型拟合次数(数万个)与交叉验证(约1000次)来评估计算效率。
- 将该方法应用于多种模型:随机森林、神经网络和提升回归树,以检验其在不同算法类型中的泛化能力。
实验结果
研究问题
- RQ1广义自由度(GDF)能否在伯努利分布数据的黑箱模型中可靠地估计模型复杂度?
- RQ2基于GDF的AICc与基于交叉验证的模型复杂度和偏差估计相比,在稳定性和准确性方面如何?
- RQ3GDF方法在实际机器学习模型选择中是否具有计算可行性,尤其是对大型或复杂模型?
- RQ4GDF方法在不同机器学习算法(包括随机森林和提升回归树)中是否产生一致结果?
- RQ5基于GDF的AIC能否有效用于模型平均,还是交叉验证是更合适的替代方案?
主要发现
- 伯努利数据的GDF估计值不稳定,且对同时扰动的数据点数量敏感性不一致,严重影响其可靠性。
- GDF方法计算成本极高,需要数万个模型拟合,使其在大多数实际应用中不可行。
- 重复10折交叉验证表现更稳健,所需假设更少,且显著快于基于GDF的估计。
- 基于GDF的AICc在某些情况下与交叉验证结果相似,但GDF估计的不稳定性限制了其实际应用价值。
- 基于交叉验证的模型复杂度估计(Δℓ^CV_m)更易于解释,且对任意扰动选择的依赖性低于GDF。
- 本研究结论认为,对于非似然模型,尤其是二值结果,交叉验证是比GDF更实用、更可靠的模型复杂度估计替代方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。