Skip to main content
QUICK REVIEW

[论文解读] Model Comparison and Calibration Assessment: User Guide for Consistent Scoring Functions in Machine Learning and Actuarial Practice

Tobias Fissler, Christian Lorentzen|arXiv (Cornell University)|Feb 25, 2022
Big Data and Business Intelligence被引用 9
一句话总结

本用户指南提出了一套严格的框架,用于在机器学习和精算科学中通过严格一致的评分函数以及针对预设预测目标功能(如均值或分位数)定制的严格识别函数,对模型进行比较和校准评估。通过真实世界案例研究,该研究证明了严格一致的评分函数(如对数损失)可同时评估校准性和区分度,尽管随机森林存在过拟合问题,逻辑回归在样本外预测精度上仍优于基于树的模型。

ABSTRACT

One of the main tasks of actuaries and data scientists is to build good predictive models for certain phenomena such as the claim size or the number of claims in insurance. These models ideally exploit given feature information to enhance the accuracy of prediction. This user guide revisits and clarifies statistical techniques to assess the calibration or adequacy of a model on the one hand, and to compare and rank different models on the other hand. In doing so, it emphasises the importance of specifying the prediction target functional at hand a priori (e.g. the mean or a quantile) and of choosing the scoring function in model comparison in line with this target functional. Guidance for the practical choice of the scoring function is provided. Striving to bridge the gap between science and daily practice in application, it focuses mainly on the pedagogical presentation of existing results and of best practice. The results are accompanied and illustrated by two real data case studies on workers' compensation and customer churn.

研究动机与目标

  • 建立一种系统化的方法,用于评估机器学习和精算应用中的模型校准性,并比较预测性能。
  • 强调在事前将评分函数和识别函数与目标统计功能(如均值、分位数)对齐的必要性。
  • 弥合理论统计方法与数据科学及精算实践之间实施应用的鸿沟。
  • 提供选择合适评分函数并使用独立测试数据评估模型的实际指导。
  • 通过实证案例研究说明模型过拟合的影响以及训练-测试数据划分的重要性。

提出的方法

  • 本文提出使用严格一致的评分函数(如对数评分(对数损失)和Bregman散度)进行模型比较,确保最优预测与真实条件功能一致。
  • 采用严格识别函数(如矩函数)通过检验预测是否相对于真实功能无偏来评估校准性。
  • 该方法应用于两个真实世界数据集:工人赔偿索赔和客户流失,分别采用回归和二分类任务。
  • 作者使用训练-测试数据划分来评估样本外性能,避免模型选择中的过拟合偏差。
  • 使用Murphy图可视化模型在一系列一致评分函数下的表现,实现超越单一指标的稳健比较。
  • 研究对对数损失进行了分解,划分为区分度和校准误差两部分,以解释不同指标间排名的一致性。

实验结果

研究问题

  • RQ1当预测目标为均值或分位数等统计功能时,如何严格评估模型校准性?
  • RQ2选择评分函数用于模型比较时应依据何种标准?其必须如何与目标功能对齐?
  • RQ3严格一致的评分函数在多大程度上能同时评估预测模型的校准性和区分度?
  • RQ4当使用一致评分函数评估时,不同模型(如逻辑回归、随机森林、XGBoost)在样本外预测精度方面表现如何?
  • RQ5AUC排名是否可信赖以反映真实预测性能,还是可能与严格一致评分函数的结果产生偏差?

主要发现

  • 尽管未通过交互项或多项式特征进行优化,逻辑回归在测试集上实现了最低的平均对数损失,表现出最佳的样本外预测性能。
  • 随机森林在训练数据上表现强劲,但存在显著过拟合,表现为测试集上的平均对数损失明显高于训练数据。
  • XGBoost在测试集上的表现略优于随机森林,但仍逊于逻辑回归,表明树模型在小样本数据集上可能泛化能力较差。
  • AUC与对数损失的排名偶然一致,但这种一致性源于对数损失分解中区分度分量占主导地位,而非校准误差。
  • Murphy图直观证实,逻辑回归在广泛一致评分函数下均表现出最一致的性能,尽管差异较小。
  • 研究证实,严格一致的评分函数(尤其是对数损失)优于AUC用于模型比较,因其具有坚实的理论基础,并能联合评估校准性和区分度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。