[论文解读] Making Classifier Chains Resilient to Class Imbalance
本文提出了ECCRU、ECCRU2和ECCRU3——ECC(集成分类器链)算法的扩展方法,通过整合随机欠采样与自适应链构建,增强了多标签学习中对类别不平衡的鲁棒性。这些方法在多个指标上提升了性能,尤其在高度不平衡的数据集上表现更优,其中ECCRU3在高不平衡比率下的大多数评估标准中表现最佳。
Class imbalance is an intrinsic characteristic of multi-label data. Most of the labels in multi-label data sets are associated with a small number of training examples, much smaller compared to the size of the data set. Class imbalance poses a key challenge that plagues most multi-label learning methods. Ensemble of Classifier Chains (ECC), one of the most prominent multi-label learning methods, is no exception to this rule, as each of the binary models it builds is trained from all positive and negative examples of a label. To make ECC resilient to class imbalance, we first couple it with random undersampling. We then present two extensions of this basic approach, where we build a varying number of binary models per label and construct chains of different sizes, in order to improve the exploitation of majority examples with approximately the same computational budget. Experimental results on 16 multi-label datasets demonstrate the effectiveness of the proposed approaches in a variety of evaluation metrics.
研究动机与目标
- 解决多标签学习中的类别不平衡问题,其中大多数标签的正样本远少于负样本。
- 提升最先进方法——集成分类器链(ECC)算法的性能,该方法因使用每个标签的所有正负样本而对类别不平衡敏感。
- 在固定计算预算下,通过调整每个标签的链数量及其大小,更好地利用多数类样本。
- 研究不平衡比率对模型性能的影响,并识别不同不平衡水平下的最优链构建策略。
提出的方法
- 提出ECCRU,对ECC中的每个二分类器应用随机欠采样,以平衡每个标签的训练数据。
- 提出ECCRU2,根据不平衡比率为每个标签构建不同数量的链,使高不平衡标签获得更多关注。
- 设计ECCRU3,对高度不平衡标签使用更短的链,对不平衡程度较低的标签使用更长的链,以优化计算预算的使用。
- 通过所有链的投票策略聚合预测结果,其中每个标签的最终得分是预测为正的链所占比例。
- 采用元策略:根据经验性能趋势,在低不平衡比率时选择ECCRU,高不平衡比率时选择ECCRU3。
- 使用五个标准指标在16个多标签数据集上评估性能:F1值、G-mean、平衡准确率、AUC-ROC和AUC-PR。
实验结果
研究问题
- RQ1随机欠采样如何提升ECC在不平衡多标签数据集上的性能?
- RQ2通过调整每个标签的链数量及其大小,是否能在不增加计算成本的前提下更好地利用多数类样本?
- RQ3标签的不平衡比率如何影响多标签学习中最佳链构建策略?
- RQ4在高度类别不平衡的情况下,ECCRU3是否优于ECCRU2和ECC?
- RQ5基于不平衡比率选择ECCRU与ECCRU3的元方法是否能带来更优的整体性能?
主要发现
- ECCRU3在五个评估指标上均取得最佳整体性能,与ECC及其他基线方法相比,在大多数比较中显著更优(p值 < 0.05)。
- 当不平衡比率 ≥15 时,所提方法在F1值、G-mean、平衡准确率、AUC-ROC和AUC-PR上的排名全面领先,尤其在ImR ≥ 100 时表现尤为突出。
- ECCRU3在所有指标上均持续优于ECCRU2,仅在平衡准确率上例外,尤其在高度不平衡环境下表现更优。
- 当ImR < 50时,ECCRU的表现优于ECCRU2和ECCRU3,表明在中等不平衡下,完整链建模更具优势。
- 分析表明,对于高ImR,通过短链更充分地利用多数类样本比建模标签依赖关系更有效;而对于低ImR,完整链更具价值。
- 基于观察到的性能权衡,假设采用元策略在低ImR时选择ECCRU、高ImR时选择ECCRU3,可进一步提升整体表现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。