Skip to main content
QUICK REVIEW

[论文解读] Optimizing Cost-Sensitive SVM for Imbalanced Data :Connecting Cluster to Classification

Qiuyan Yan, Shixiong Xia|arXiv (Cornell University)|Feb 6, 2017
Imbalanced Data Classification Techniques参考文献 9被引用 7
一句话总结

该论文提出PCS-SVM,一种通过聚类概率密度函数(基于相似性矩阵和超参数估计)优化惩罚参数C的代价敏感SVM方法,提升了类别不平衡数据中少数类的检测性能。该方法在真实煤与瓦斯突出监测数据上实现99.35%的灵敏度,优于传统代价敏感和混合方法。

ABSTRACT

Class imbalance is one of the challenging problems for machine learning in many real-world applications, such as coal and gas burst accident monitoring: the burst premonition data is extreme smaller than the normal data, however, which is the highlight we truly focus on. Cost-sensitive adjustment approach is a typical algorithm-level method resisting the data set imbalance. For SVMs classifier, which is modified to incorporate varying penalty parameter(C) for each of considered groups of examples. However, the C value is determined empirically, or is calculated according to the evaluation metric, which need to be computed iteratively and time consuming. This paper presents a novel cost-sensitive SVM method whose penalty parameter C optimized on the basis of cluster probability density function(PDF) and the cluster PDF is estimated only according to similarity matrix and some predefined hyper-parameters. Experimental results on various standard benchmark data sets and real-world data with different ratios of imbalance show that the proposed method is effective in comparison with commonly used cost-sensitive techniques.

研究动机与目标

  • 解决真实应用场景(如煤与瓦斯突出监测)中的类别不平衡问题,其中少数类前兆数据极为稀少但至关重要。
  • 克服传统代价敏感SVM中基于经验或迭代的C值选择方法的局限性,后者耗时且缺乏理论依据。
  • 通过从相似性矩阵中进行概率密度估计,利用聚类结构提升少数类分类性能。
  • 开发一种直接基于聚类概率优化C值的方法,从而将决策边界调整至多数类方向,而非依赖任意阈值。
  • 在标准基准数据集和真实世界不平衡数据集上均展示出优越性能,尤其在灵敏度和G-mean指标上表现突出。

提出的方法

  • 仅利用数据点之间的相似性矩阵和预设超参数,估计聚类概率密度函数(PDF),避免复杂的密度估计过程。
  • 引入改进的对偶拉格朗日优化方法,为正负两类分别设置C+和C−参数,其中C+基于聚类PDF进行优化。
  • 重构SMO算法,将聚类概率引入α更新规则,建立支持向量之间的相似性与其聚类概率之间的关联。
  • 识别误分类为负类的真正类支持向量(即假阴性支持向量),并根据聚类概率重新分类,以实现决策边界向多数类方向移动。
  • 在混合方法PCS-SMOTE-SVM中使用多项式核函数并结合SMOTE过采样,进一步增强少数类的表示与性能。
  • 通过最大化正类聚类的概率密度来优化C+,确保超平面调整方式有利于少数类检测。

实验结果

研究问题

  • RQ1能否从相似性矩阵中估计聚类概率密度,从而为代价敏感SVM参数提供一种有理论依据、非迭代的设定方法?
  • RQ2基于聚类PDF优化C值的方法,在少数类检测性能上,相较于基于经验或指标的C值选择方法,表现如何?
  • RQ3所提出的PCS-SVM方法在高度不平衡的真实世界数据(如煤与瓦斯突出监测)上,对灵敏度和G-mean的提升程度如何?
  • RQ4将PCS-SVM与SMOTE结合(即PCS-SMOTE-SVM)是否能优于独立的代价敏感或采样方法?
  • RQ5基于聚类的C值优化是否能减少对迭代超参数调优的依赖,同时保持或提升分类准确率?

主要发现

  • 在真实煤与瓦斯突出电磁监测数据集上,PCS-SVM实现了99.35%的灵敏度,显著优于SVM(2.11%)和CS-SVM(65.99%)。
  • PCS-SMOTE-SVM的AUC达到0.7770,较SMOTE-SVM(AUC 0.4816)提升29.54%,表明其在不平衡数据上具有出色的泛化能力。
  • 在标准基准数据集上,PCS-SVM优于所有算法级代价敏感方法,并在G-mean和F-measure指标上与SVM-RUS等混合方法持平或超越。
  • 该方法在不同核函数下表现稳健,多项式核与RBF核在平均评估指标上无显著差异。
  • 在所有算法级方法中,PCS-SVM在平均F-measure和G-mean上均表现最优,且在16个数据集中的8个上于三项评估指标的平均值中排名第一。
  • 基于聚类PDF的C值优化实现了有效的边界调整,且无需迭代调优,降低了计算成本,同时提升了少数类检测性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。