Skip to main content
QUICK REVIEW

[论文解读] Robustness investigation of cross-validation based quality measures for model assessment

Thomas Most, Lars Gräning|arXiv (Cornell University)|Aug 8, 2024
Fault Detection and Control Systems被引用 4
一句话总结

本文研究了基于交叉验证的质量度量(特别是预后系数 CoP)在评估机器学习模型预测性能时的鲁棒性和准确性。提出通过残差自举法获得置信区间,并引入局部误差估计量,表明在训练数据有限的情况下,k折交叉验证比留一法能提供更可靠的 CoP 估计。

ABSTRACT

In this paper the accuracy and robustness of quality measures for the assessment of machine learning models are investigated. The prediction quality of a machine learning model is evaluated model-independent based on a cross-validation approach, where the approximation error is estimated for unknown data. The presented measures quantify the amount of explained variation in the model prediction. The reliability of these measures is assessed by means of several numerical examples, where an additional data set for the verification of the estimated prediction error is available. Furthermore, the confidence bounds of the presented quality measures are estimated and local quality measures are derived from the prediction residuals obtained by the cross-validation approach.

研究动机与目标

  • 评估基于交叉验证的质量度量在机器学习模型预测准确性方面的可靠性和鲁棒性。
  • 评估预后系数(CoP)作为未知数据预测的模型无关度量的性能。
  • 通过残差自举法在不重新训练模型的情况下,估计 CoP 的统计置信区间。
  • 开发局部质量度量(局部均方根误差和局部 CoP),用于识别模型拟合不佳的区域。
  • 比较不同交叉验证策略(k折与留一法)在预测误差估计中的稳定性与保守性。

提出的方法

  • 采用 k 折交叉验证来估计预测误差,并将预后系数(CoP)作为解释变异的模型无关度量进行计算。
  • 直接在交叉验证残差上应用残差自举法,以在不重新训练模型的情况下推导 CoP 的置信区间。
  • 引入局部误差度量——局部均方根误差和局部 CoP——通过交叉验证残差按数据点计算,用于局部化模型质量评估。
  • 使用具有已知验证数据的数值示例,验证在不同训练集大小下 CoP 估计值和置信区间的可靠性。
  • 从稳定性和保守性角度比较 k 折与留一法交叉验证在小样本数据下 CoP 估计的表现。
  • 在包含 10 个输入和 4 个输出的真实自动驾驶车辆仿真场景(切入场景)中验证该方法,训练样本最多达 1866 个。

实验结果

研究问题

  • RQ1通过不同交叉验证程序估计的预后系数(CoP)在鲁棒性和准确性方面如何?
  • RQ2是否能仅从交叉验证残差中可靠地估计基于自举法的 CoP 置信区间,而无需额外的模型训练?
  • RQ3在训练数据有限的情况下,k 折与留一法交叉验证在 CoP 估计的稳定性和保守性方面有何差异?
  • RQ4局部质量度量(局部均方根误差和局部 CoP)在识别模型性能较差区域方面的有效程度如何?
  • RQ5估计的 CoP 值与独立验证数据上的实际预测性能之间的相关性如何?

主要发现

  • k 折交叉验证在小样本训练集下比留一法产生更保守且更稳定的 CoP 估计。
  • 基于自举法的 CoP 置信区间与验证数据上的真实预测误差高度吻合,验证了其可靠性。
  • 在切入场景中,CoP 从 280 个训练样本时的 66.6% 提升至 1866 个训练样本时的 82.4%,验证的决定系数(CoD)值与估计的 CoP 密切一致。
  • 局部 CoP 和均方根误差度量成功识别出预测误差较高的区域,从而可通过额外采样实现针对性的模型改进。
  • 即使在 1866 个训练样本下,模型仍无法完全捕捉时间头距行为,但估计的 CoP 仍是预测质量的可靠指标。
  • 残差自举法无需重新训练即可实现准确的置信区间,使其在模型评估流程中具有高效实用的潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。