[论文解读] A Method for Handling Multi-class Imbalanced Data by Geometry based Information Sampling and Class Prioritized Synthetic Data Generation (GICaPS)
本文提出 GICaPS,一种用于多类别数据不平衡学习的新型数据处理框架,结合基于几何的欠采样与类别优先的过采样。通过利用角度约束去除冗余的多数类样本,并在低重叠区域生成合成数据以尊重类别边界,GICaPS 在 Shuttle 数据集上实现了 99.39% 的平均准确率,显著优于 SMOTE 和 ADASYN 在十个不平衡数据集上的表现。
This paper looks into the problem of handling imbalanced data in a multi-label classification problem. The problem is solved by proposing two novel methods that primarily exploit the geometric relationship between the feature vectors. The first one is an undersampling algorithm that uses angle between feature vectors to select more informative samples while rejecting the less informative ones. A suitable criterion is proposed to define the informativeness of a given sample. The second one is an oversampling algorithm that uses a generative algorithm to create new synthetic data that respects all class boundaries. This is achieved by finding \\emph{no man's land} based on Euclidean distance between the feature vectors. The efficacy of the proposed methods is analyzed by solving a generic multi-class recognition problem based on mixture of Gaussians. The superiority of the proposed algorithms is established through comparison with other state-of-the-art methods, including SMOTE and ADASYN, over ten different publicly available datasets exhibiting high-to-extreme data imbalance. These two methods are combined into a single data processing framework and is labeled as ``GICaPS'' to highlight the role of geometry-based information (GI) sampling and Class-Prioritized Synthesis (CaPS) in dealing with multi-class data imbalance problem, thereby making a novel contribution in this field.
研究动机与目标
- 为解决现实应用中多类别数据不平衡的挑战,例如欺诈检测和医学诊断,其中少数类至关重要但代表性不足。
- 克服现有采样方法(如 SMOTE 和 ADASYN)的局限性,这些方法常生成噪声样本,或在高重叠、高不平衡场景下失效。
- 开发一个统一框架,结合基于几何原理的欠采样与过采样,以保留信息丰富的样本并尊重类别边界。
- 提供一个理论基础坚实、可实现的方法,在不依赖昂贵重加权或集成技术的前提下,提升极端类别不平衡(例如 10,000:1)场景下的分类器性能。
- 在具有高至极端不平衡的多样化公开数据集上验证该方法,证明其在性能上持续优于最先进技术。
提出的方法
- 该欠采样方法利用特征向量之间的夹角识别并移除冗余的多数类样本,同时保留位于不同正交象限中的样本,以维持类别可分性。
- 基于多数类中心的夹角偏离度定义样本信息量,确保仅移除信息量较低的样本。
- 该过采样方法在类别间密度较低的区域生成合成少数类样本,通过基于欧氏距离的边界检测避免在类别之间的“无人区”生成样本。
- 该框架采用类别优先的合成策略,集中于少数类边界附近生成样本,以提升泛化能力并减少重叠。
- 数学公式为欠采样中的角度约束和过采样中的距离基无人区检测提供理论基础。
- 提供了两个算法的伪代码,支持可复现实现,并可轻松集成到现有机器学习流程中。
实验结果
研究问题
- RQ1能否有效利用特征向量之间的几何关系,识别并移除冗余的多数类样本,同时保留信息丰富的样本?
- RQ2能否通过类间边界的感知引导合成数据生成,避免在重叠区域生成模糊或噪声样本?
- RQ3结合基于几何的欠采样与类别优先的过采样,是否能在多样化的高度不平衡多类别数据集上实现一致的性能提升?
- RQ4在真实世界不平衡数据集上,所提出的 GICaPS 框架相较于 SMOTE、ADASYN 及其他最先进方法,在准确率、F-measure 和 G-mean 指标上的表现如何?
- RQ5在极端类别不平衡比例下(例如 >10,000:1),该框架是否能在不依赖代价敏感学习或集成方法的前提下保持高性能?
主要发现
- 在 Shuttle 数据集上,GICaPS 实现了 99.39% 的总体准确率,显著高于 SMOTE(96.59%)和 ADASYN(56.27%),表明其在极端不平衡场景下具有强大性能。
- 在 Abalone 数据集上,GICaPS-O(仅过采样)实现了 96.80% 的精确率和 96.32% 的 F-measure,优于 SMOTE(75.71% F-measure)和 ADASYN(33.5% F-measure)。
- 在 Pima Indian Diabetes 数据集上,GICaPS-O 实现了 84.15% 的总体准确率,超过 SMOTE(76.40%)和 ADASYN(75.45%),且在 F-measure 和 G-mean 上均有稳定提升。
- 在 Pain 数据集上,GICaPS 实现了 98.80% 的总体准确率和 98.79% 的 F-measure,显著优于 SMOTE(90.33%)和 ADASYN(17.45% F-measure),尤其在少数类的召回率方面表现突出。
- 该框架在所有评估指标上均持续优于 SIMO、WSIMO、SWIM 和 MOCAS (NN),在多个数据集(如 Glass(96.7)和 Ionosphere(89.43))上表现出最高的 G-mean。
- 表 VII 中的统计比较证实,GICaPS 在十大数据集上的 OA、F-measure 和 G-mean 平均表现上均显著优于所有基线方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。