Skip to main content
QUICK REVIEW

[论文解读] Beyond Random Split for Assessing Statistical Model Performance

Carlos Catania, J.E. Castillo Guerra|arXiv (Cornell University)|Sep 4, 2022
Neural Networks and Applications被引用 4
一句话总结

本文提出非随机的数据划分策略——基于差异性的、基于信息的和基于聚类的策略,以在数据集非代表性时(尤其是罕见或难以捕捉的样本)改进机器学习中的泛化误差估计。基于CTU19僵尸网络数据集和两种基于树的分类器,研究结果表明,与标准蒙特卡洛划分相比,替代划分策略(尤其是基于聚类和基于信息的策略)在低代表性场景下能提供更真实、更悲观的性能估计。

ABSTRACT

Even though a train/test split of the dataset randomly performed is a common practice, could not always be the best approach for estimating performance generalization under some scenarios. The fact is that the usual machine learning methodology can sometimes overestimate the generalization error when a dataset is not representative or when rare and elusive examples are a fundamental aspect of the detection problem. In the present work, we analyze strategies based on the predictors' variability to split in training and testing sets. Such strategies aim at guaranteeing the inclusion of rare or unusual examples with a minimal loss of the population's representativeness and provide a more accurate estimation about the generalization error when the dataset is not representative. Two baseline classifiers based on decision trees were used for testing the four splitting strategies considered. Both classifiers were applied on CTU19 a low-representative dataset for a network security detection problem. Preliminary results showed the importance of applying the three alternative strategies to the Monte Carlo splitting strategy in order to get a more accurate error estimation on different but feasible scenarios.

研究动机与目标

  • 解决在非代表性数据集上使用随机训练/测试划分时,对模型泛化误差的过度估计问题。
  • 评估不同数据划分策略对模型性能估计的影响,尤其是在罕见或异常样本代表性不足的情况下。
  • 评估基于预测器的采样策略是否相比标准随机划分能提高泛化误差估计的准确性。
  • 为在不同数据代表性水平下评估模型鲁棒性(尤其在网络安全检测任务中)提供一个框架。
  • 证明在代表性较低的场景下,替代划分策略相比标准蒙特卡洛划分能提供更悲观且更真实的性能估计。

提出的方法

  • 采用四种数据划分策略:蒙特卡洛(随机划分)、基于差异性的(最大化训练集与测试集样本间的距离)、基于信息的(利用群体级信息隔离测试集)和基于聚类的(使用k-means划分预测空间)。
  • 在CTU19数据集上应用两种基线决策树分类器(CART和C5.0),该数据集为低代表性网络安全部队检测数据集。
  • 使用文献[3]中的算法量化训练集与测试集之间的重叠程度,以衡量代表性差异。
  • 使用标准指标(平衡准确率、F1、敏感度和特异度)评估所有划分策略下的模型性能。
  • 对每种策略进行多次重采样(类似蒙特卡洛方法),以评估性能估计的稳定性和变异性。
  • 通过比较各策略下性能指标的中位数和四分位距,评估其鲁棒性和估计准确性。

实验结果

研究问题

  • RQ1数据划分策略的选择如何影响在非代表性数据集中对模型泛化误差的估计?
  • RQ2基于预测器的采样策略(基于差异性、聚类、基于信息分组)是否能相比随机划分提高性能估计的准确性?
  • RQ3训练集与测试集之间代表性差异的变化对模型性能指标(如平衡准确率和F1)有何影响?
  • RQ4不同划分策略在真实但具有挑战性的数据分布偏移下,如何反映模型的鲁棒性?
  • RQ5替代划分策略在多大程度上能提供比标准蒙特卡洛划分更悲观、因而更真实的性能估计?

主要发现

  • 尽管蒙特卡洛划分策略是标准做法,但由于训练集与测试集样本高度相似,导致其高估了模型性能(中位数平衡准确率为0.91)。
  • 基于差异性的划分策略因初始集合选择不佳,导致估计误差增加(中位数平衡准确率为0.75),表明在小数据集中存在不稳定性。
  • 基于信息的划分策略表现出更宽泛的性能范围(平衡准确率在0.75至0.91之间),表明在代表性较低时,0.75可能代表最坏情况。
  • 基于聚类的划分策略提供了最悲观的估计(中位数平衡准确率为0.82),同时F1值更高(0.93)且变异性增加,表明其在极端分布偏移下具备鲁棒性测试能力。
  • 在真实世界部署中,尤其在非代表性数据场景下,基于聚类和基于信息的策略相比蒙特卡洛策略能提供更真实可靠的性能估计。
  • 所有策略均表明,训练集与测试集之间代表性微小差异会显著影响性能指标,尤其是F1和敏感度,凸显了在模型评估中谨慎划分的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。