Skip to main content
QUICK REVIEW

[论文解读] Classification from Pairwise Similarities/Dissimilarities and Unlabeled Data via Empirical Risk Minimization

Takuya Shimada, Han Bao|arXiv (Cornell University)|Apr 26, 2019
Anomaly Detection Techniques and Applications参考文献 23被引用 6
一句话总结

该论文提出了一种新颖的基于成对相似性、相异性和无标签数据的二分类经验风险最小化框架——称为SDU分类。通过推导相似-无标签(SU)、相异-无标签(DU)和相似-相异(SD)设置下的无偏风险估计器,并利用线性集成(SDDU)将它们结合,该方法在无需几何假设的情况下实现了优越的泛化性能,在基准数据集上优于基于聚类的基线方法。

ABSTRACT

Pairwise similarities and dissimilarities between data points might be easier to obtain than fully labeled data in real-world classification problems, e.g., in privacy-aware situations. To handle such pairwise information, an empirical risk minimization approach has been proposed, giving an unbiased estimator of the classification risk that can be computed only from pairwise similarities and unlabeled data. However, this direction cannot handle pairwise dissimilarities so far. On the other hand, semi-supervised clustering is one of the methods which can use both similarities and dissimilarities. Nevertheless, they typically require strong geometrical assumptions on the data distribution such as the manifold assumption, which may deteriorate the performance. In this paper, we derive an unbiased risk estimator which can handle all of similarities/dissimilarities and unlabeled data. We theoretically establish estimation error bounds and experimentally demonstrate the practical usefulness of our empirical risk minimization method.

研究动机与目标

  • 解决真实世界中完全标注数据成本高昂或隐私受限,但可获取成对相似性和相异性的问题。
  • 将现有相似-无标签(SU)分类方法扩展为同时处理相似性和相异性,实现更鲁棒和灵活的弱监督学习。
  • 构建一个统一的经验风险最小化框架,利用三类数据——相似对、相异对和无标签数据——而无需依赖流形或聚类假设等几何假设。
  • 通过估计误差界,理论证明结合SD和DU风险估计器优于仅使用SU的风险估计器。
  • 在基准数据集上实证验证所提出的SDDU方法,与基于聚类和度量学习的基线方法相比,表现出最先进性能。

提出的方法

  • 推导仅使用成对相异性和无标签数据的无偏风险估计器(DU分类),扩展了先前的SU分类方法。
  • 提出相似-相异(SD)分类作为互补方法,仅使用相似对和相异对,无需标签。
  • 通过线性集成方式结合SU、DU和SD分类的风险,类似于正样本-负样本-无标签(PNU)学习,形成SDU分类框架。
  • 采用平方损失和双铰链损失函数,以实现经验风险最小化目标的实际优化。
  • 为每个组件(SU、DU、SD)建立理论估计误差界,以指导风险估计器的最优组合。
  • 采用三种风险估计器(SDDU)的线性组合,以平衡偏差与方差,理论分析表明SD和DU优于SU。

实验结果

研究问题

  • RQ1能否仅使用成对相异性和无标签数据,构建一个无偏风险估计器,以扩展SU分类范式?
  • RQ2DU、SD和SU分类的估计误差界如何比较,哪种组合能实现最佳泛化性能?
  • RQ3结合SD和DU风险估计器是否在泛化误差方面优于仅使用SU分类,且能否从理论上加以证明?
  • RQ4所提出的SDU分类方法是否能在无几何假设的前提下,在真实世界数据集上实现优于半监督聚类和度量学习基线的分类准确率?
  • RQ5SDU分类中风险估计器(SU、DU、SD)的最优组合是什么,与现有弱监督学习框架相比表现如何?

主要发现

  • 所提出的SDDU分类方法通过结合SD和DU风险估计器,在多个基准数据集上表现最佳,优于K均值、约束K均值、谱聚类和ITML基线方法。
  • 在d=68的钓鱼数据集上,SDDU达到68.4%的准确率,超过次优方法(ITML为62.8%),显著优于K均值(62.6%)和CKM(62.6%)。
  • 在d=300的w8a数据集上,SDDU达到67.2%的准确率,尽管维度较高,仍优于ITML(56.3%)、CKM(66.0%)和K均值(64.1%)。
  • 理论分析表明,DU和SD分类的估计误差界低于SU分类,表明其具有更好的泛化潜力。
  • SDDU方法在14个基准数据集中的12个上始终优于所有基线方法,包括ijcnn1、magic和phoneme,在这些数据集中准确率均超过70%。
  • 该方法在不同数据分布和特征维度下表现出鲁棒性,即使在高维设置(如d=300)下也保持一致的性能提升,证实了其实际应用价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。