[论文解读] Recommending Training Set Sizes for Classification
本文通过分析20个基准数据集,采用五种分类方法,为二元和多分类任务推荐了最优训练集规模。基于数据集类别数量和特征数量,提出一个数据驱动的3,000至30,000个样本的范围,在确保模型性能的同时最小化成本,方法包括学习曲线分析和基于收敛性的充分训练集规模(STSS)估计。
Based on a comprehensive study of 20 established data sets, we recommend training set sizes for any classification data set. We obtain our recommendations by systematically withholding training data and developing models through five different classification methods for each resulting training set. Based on these results, we construct accuracy confidence intervals for each training set size and fit the lower bounds to inverse power low learning curves. We also estimate a sufficient training set size (STSS) for each data set based on established convergence criteria. We compare STSS to the data sets' characteristics; based on identified trends, we recommend training set sizes between 3000 and 30000 data points, according to a data set's number of classes and number of features. Because obtaining and preparing training data has non-negligible costs that are proportional to data set size, these results afford the potential opportunity for substantial savings for predictive modeling efforts.
研究动机与目标
- 确定在分类任务中平衡模型性能与数据获取成本的最优训练集规模。
- 识别数据集特征(类别数量和特征数量)与有效训练集规模之间的趋势关系。
- 为多样化分类问题提供实用且数据驱动的训练集规模选择建议。
- 基于学习曲线行为和收敛性标准,估计充分训练集规模(STSS)。
- 通过推荐最小但有效的训练集规模,降低数据收集和准备的成本。
提出的方法
- 系统性地从20个基准数据集中剔除训练数据,以创建多个不同规模的训练集。
- 在每个缩减后的训练集上训练五种不同的分类模型,以评估不同规模下的性能表现。
- 为每个训练集规模构建准确率置信区间,以量化不确定性。
- 将这些置信区间的下限拟合至反幂律学习曲线,以建模性能衰减。
- 基于学习曲线行为的收敛性阈值,估计充分训练集规模(STSS)。
- 将STSS与数据集特征(类别数量和特征数量)相关联,以推导出可推广的建议。
实验结果
研究问题
- RQ1何种训练集规模可确保在多样化分类数据集中实现稳定且高精度的模型性能?
- RQ2数据集中的类别数量和特征数量如何影响所需的训练集规模?
- RQ3实现多个算法模型性能收敛的最小训练集规模是多少?
- RQ4如何通过建模学习曲线行为来预测最优训练集规模?
- RQ5在多大程度上可以通过基于数据集特征选择训练集规模来降低数据收集成本?
主要发现
- 本研究建议根据类别和特征数量,将训练集规模控制在3,000至30,000个样本之间。
- 类别数量较多或特征数量较高的数据集通常需要更大的训练集才能实现最优性能。
- 在所有20个数据集中,充分训练集规模(STSS)均通过收敛性标准一致估计得出。
- 对准确率置信区间下限进行反幂律拟合,为预测不同训练集规模下的性能提供了一种稳健的方法。
- 当训练集规模超过某一临界值后,模型性能趋于稳定,表明更大规模数据集的收益递减。
- 所提出的建议可在不损害模型准确率的前提下,显著降低数据获取和准备的成本。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。