[论文解读] Synthetic Oversampling of Multi-Label Data based on Local Label Distribution
本文提出 MLSOL,一种新颖的多标签数据合成过采样方法,通过聚焦少数类样本周围的局部标签分布,生成多样化且标注良好的实例。通过利用局部标签特征并集成至集成框架中,MLSOL 在多个评估指标和基础分类器上显著提升性能,优于最先进的方法如 MLSMOTE 和 RHwRSMT,尤其在集成设置中表现更优。
Class-imbalance is an inherent characteristic of multi-label data which affects the prediction accuracy of most multi-label learning methods. One efficient strategy to deal with this problem is to employ resampling techniques before training the classifier. Existing multilabel sampling methods alleviate the (global) imbalance of multi-label datasets. However, performance degradation is mainly due to rare subconcepts and overlapping of classes that could be analysed by looking at the local characteristics of the minority examples, rather than the imbalance of the whole dataset. We propose a new method for synthetic oversampling of multi-label data that focuses on local label distribution to generate more diverse and better labeled instances. Experimental results on 13 multi-label datasets demonstrate the effectiveness of the proposed approach in a variety of evaluation measures, particularly in the case of an ensemble of classifiers trained on repeated samples of the original data.
研究动机与目标
- 为解决多标签数据集中由罕见子概念和标签重叠引起的类别不平衡问题,而非全局不平衡。
- 通过聚焦局部标签分布而非全局标签频率,提升过采样过程中生成的合成实例的质量与多样性。
- 开发一种灵活且兼容集成的重采样方法,提升多标签学习模型的鲁棒性与准确性。
- 证明基于局部标签分布的分析优于全局或逐标签方法,可生成更优的合成数据。
- 在多样化数据集、评估指标及基础多标签学习算法上验证 MLSOL 的有效性。
提出的方法
- MLSOL 基于局部标签分布选择种子实例,优先选择具有复杂标签子概念和重叠的少数类样本。
- 通过组合邻近实例的特征与标签生成合成实例,采用加权采样策略,突出信息丰富的局部模式。
- 该方法采用标签选择机制,优先选择在局部邻域中出现的标签,确保合成实例在语义上一致且多样化。
- MLSOL 集成至一个简单的集成框架中,通过在种子选择和合成实例生成过程中引入随机化,提升模型多样性。
- 集成版本 EMLSOL 通过多次重复采样训练多个模型并聚合结果,降低方差并提升泛化能力。
- 该方法设计为兼容任意多标签学习算法,可无缝集成至现有机器学习流水线中。
实验结果
研究问题
- RQ1聚焦局部标签分布而非全局或逐标签不平衡,是否能提升多标签数据中的合成过采样性能?
- RQ2与 MLSMOTE 和 RHwRSMT 等现有方法相比,MLSOL 是否能生成更多样化且标注更优的合成实例?
- RQ3MLSOL 的集成版本(EMLSOL)是否在多个评估指标上显著优于单模型版本及当前最先进基线?
- RQ4当与不同基础多标签学习方法结合时,MLSOL 在类别不平衡感知评估指标下的表现如何?
- RQ5局部标签分布分析在多大程度上缓解了由罕见子概念和标签重叠导致的性能下降?
主要发现
- EMLSOL 在全部 18 种组合(6 种基础多标签方法与 3 种评估指标)中均取得最佳平均排名,未出现显著损失且表现一致领先。
- MLSOL 在全部 13 个基准数据集上均优于 MLSMOTE 和 RHwRSMT,尤其在 AUC-ROC 和 AUCPR 指标上表现突出,这两项指标对类别不平衡敏感。
- MLSOL 的集成版本(EMLSOL)在 AUC-ROC 和 AUCPR 上均取得 36 场全胜,表明其性能优越且高度稳定。
- 尽管 MLSOL 与 MLSMOTE 在单模型性能上相近,但 EMLSOL 因种子选择与生成过程具有更高内在随机性,从集成中获益更显著。
- RHwRSMT 表现劣于默认设置(无重采样),原因在于 REMEDIAL 引入了混淆实例,凸显了复杂分解在重采样中的风险。
- 结果证实,与全局或逐标签策略相比,局部标签分布是更有效的合成过采样基础,尤其在复杂且标签重叠的场景中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。