Skip to main content
QUICK REVIEW

[论文解读] Discriminative Ridge Machine: A Classifier for High-Dimensional Data or Imbalanced Data

Chong Peng, Qiang Cheng|arXiv (Cornell University)|Apr 16, 2019
Face and Expression Recognition参考文献 76被引用 6
一句话总结

本文提出了一种新型分类器——判别岭机器(Discriminative Ridge Machine, DRM),通过引入结构化正则化项 $ S_w(w) $ 显式地整合类别间判别信息,从而在岭回归基础上实现性能提升。DRM 在高维和类别不平衡数据上表现优异,小规模数据下具有闭式解,大规模数据则采用三种高效的迭代算法,其性能优于当前最先进的方法,包括支持向量机(SVM)和核岭回归(KRR)。

ABSTRACT

We introduce a discriminative regression approach to supervised classification in this paper. It estimates a representation model while accounting for discriminativeness between classes, thereby enabling accurate derivation of categorical information. This new type of regression models extends existing models such as ridge, lasso, and group lasso through explicitly incorporating discriminative information. As a special case we focus on a quadratic model that admits a closed-form analytical solution. The corresponding classifier is called discriminative regression machine (DRM). Three iterative algorithms are further established for the DRM to enhance the efficiency and scalability for real applications. Our approach and the algorithms are applicable to general types of data including images, high-dimensional data, and imbalanced data. We compare the DRM with currently state-of-the-art classifiers. Our extensive experimental results show superior performance of the DRM and confirm the effectiveness of the proposed approach.

研究动机与目标

  • 解决传统分类器(如KNN和SVM)在高维和类别不平衡数据设置下的局限性。
  • 通过将类别级监督整合到回归框架中,克服近邻方法缺乏判别信息的问题。
  • 提出一类新型判别岭回归模型,显式考虑类别间可分性与类内紧凑性。
  • 设计一种适用于大规模、高维和类别不平衡数据应用的可扩展、高效分类器。
  • 建立理论与实证证据,证明所提方法在准确率与鲁棒性方面优于现有最先进分类器。

提出的方法

  • 提出一种判别岭回归模型,通过结构化正则化项 $ S_w(w) $ 扩展岭回归、套索回归(lasso)和组套索回归(group lasso),显式引入类别判别信息。
  • 将DRM形式化为一种特殊情况,采用带闭式解析解的二次优化目标,实现小规模或高维数据集上的快速推理。
  • 提出三种用于大规模数据的迭代优化算法,每种算法在使用线性核时均具有全局收敛性与线性样本规模计算成本。
  • 通过连续相似性向量实现软标签监督,而非二值标签,从而实现比标准KNN更丰富的表征学习。
  • 通过矩阵 $ B $ 实现类别加权,通过为小类别分配更高权重来缓解类别不平衡问题。
  • 应用式(11)中的决策规则,选择后验概率最大的类别,提供几何可解释的分类边界。

实验结果

研究问题

  • RQ1能否在岭回归框架中显式引入判别信息以提升高维数据上的分类性能?
  • RQ2与标准岭回归或KRR相比,引入类别判别正则化项 $ S_w(w) $ 对模型准确率与鲁棒性有何影响?
  • RQ3DRM在不依赖数据层面采样技术的情况下,能在类别不平衡数据上保持多高的准确率与可扩展性?
  • RQ4针对大规模数据,DRM所推导的迭代算法在计算效率与收敛行为方面表现如何?
  • RQ5在类别不平衡与高维基准数据集上,DRM与SVM和KRR等最先进分类器相比,在精确率、召回率与F1分数方面表现如何?

主要发现

  • DRM在标准大规模数据集上的分类准确率与SVM相当,证实了其泛化能力。
  • 在高维数据上,由于采用了判别正则化,DRM显著优于当前最先进分类器,包括SVM与KRR。
  • 在类别不平衡数据上,DRM即使不使用数据层面的采样技术也能保持强劲性能,且在结合SMOTE等技术后性能进一步提升。
  • 消融研究证实,判别项 $ S_w(w) $ 至关重要:DRM在所有 $ \beta $ 值与核函数类型(RBF与多项式)下均持续优于KRR。
  • 采用迭代算法的线性DRM在样本规模上实现线性计算成本与全局收敛性,效率与线性SVM相当,同时准确率更高。
  • DRM的闭式解使得其在小规模或高维数据集上能够实现快速且精确的推理,适用于实时与资源受限的应用场景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。