[论文解读] Similarity Based Stratified Splitting: an approach to train better classifiers
本文提出了一种基于相似性的分层分割方法(SBSS),这是一种新颖的数据分割方法,通过利用输入空间和输出空间的相似性,将相似样本分配到不同的训练集和测试集中,从而提升分类器性能。在22个数据集上使用多种分类器进行评估,SBSS在75%的情况下显著优于标准的10折交叉验证,证明了其是一种低成本、与分类器无关的策略,可有效提升真实世界模型的泛化能力。
We propose a Similarity-Based Stratified Splitting (SBSS) technique, which uses both the output and input space information to split the data. The splits are generated using similarity functions among samples to place similar samples in different splits. This approach allows for a better representation of the data in the training phase. This strategy leads to a more realistic performance estimation when used in real-world applications. We evaluate our proposal in twenty-two benchmark datasets with classifiers such as Multi-Layer Perceptron, Support Vector Machine, Random Forest and K-Nearest Neighbors, and five similarity functions Cityblock, Chebyshev, Cosine, Correlation, and Euclidean. According to the Wilcoxon Sign-Rank test, our approach consistently outperformed ordinary stratified 10-fold cross-validation in 75\\% of the assessed scenarios.
研究动机与目标
- 为解决传统数据分割方法未能考虑输入空间相似性而导致模型泛化性能欠佳的问题。
- 开发一种数据分割策略,通过确保训练集和测试集更好地反映数据分布,从而提升模型性能。
- 提出一种与分类器无关、计算成本低的方法,以提升模型泛化能力,且无需修改学习算法。
- 通过统计显著性检验,在多种数据集和分类器上评估SBSS的有效性。
- 探究不同相似性函数(如欧几里得、余弦、相关性)对SBSS下模型性能的影响。
提出的方法
- SBSS使用相似性函数测量输入空间中样本之间的成对距离,同时结合输入特征和输出标签。
- 基于样本的相似性将样本聚类,并在各折之间进行分割,以最小化折内相似性,同时保持类别分布。
- 该方法应用分层分割以在各折中保持类别比例,并通过相似性约束增强,以减少训练数据中的冗余。
- 评估了五种相似性函数——曼哈顿距离(Cityblock)、切比雪夫距离(Chebyshev)、余弦相似性(Cosine)、相关性(Correlation)和欧几里得距离(Euclidean),以确定其对模型性能的影响。
- 该算法确保相似样本被分配到不同折中,从而在训练过程中促进多样性并提升泛化能力。
- SBSS在10折交叉验证框架下应用,并通过Wilcoxon符号秩检验与标准分层10折交叉验证进行性能对比。
实验结果
研究问题
- RQ1与标准分层分割相比,将输入空间相似性纳入数据分割是否能提升分类器的泛化能力?
- RQ2相似性函数的选择(如欧几里得、余弦、相关性)如何影响SBSS的性能增益?
- RQ3SBSS是否能在多种数据集和分类器类型上持续提升模型性能?
- RQ4SBSS的性能增益在多个基准数据集上是否具有统计显著性?
- RQ5SBSS是否通过更准确地反映数据分布,减少了过拟合并提升了真实世界性能估计的准确性?
主要发现
- 在75%的评估场景中,SBSS显著优于标准10折交叉验证,Wilcoxon符号秩检验确认了统计显著性。
- 在22个数据集和四种分类器(MLP、SVM、KNN、RF)的440次总比较中,SBSS在330次中提升了测试准确率(占75%)。
- 对于使用相关性相似性的SVM分类器,SBSS相比标准10折交叉验证平均提升了1.121%的准确率,且在统计检验中取得16胜0负。
- 所有数据集和分类器的平均准确率增益为:训练集+0.428%,测试集+1.547%,Wilcoxon检验结果为1胜/12负/9平。
- SBSS在多种数据集上均表现出一致的性能提升,包括高维数据集(如'vowel'和'madelon')和类别不平衡数据集(如'credit-g'和'diabetes')。
- 该方法与分类器无关,计算成本极低,适用于学术和工业机器学习流水线中的实际部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。