Skip to main content
QUICK REVIEW

[论文解读] Novelty Detection in MultiClass Scenarios with Incomplete Set of Class Labels

Nomi Vinokurov, Daphna Weinshall|arXiv (Cornell University)|Apr 21, 2016
Anomaly Detection Techniques and Applications参考文献 21被引用 5
一句话总结

本文提出了一种新颖的基于集成的方法,用于在多类场景中检测训练时缺失类别标签的新类别。该方法利用多类分类器的置信度分数,比较前两名类别的亲和度,并在已知类别与新类别随机划分的子集上训练一组二分类器,以生成更优的新颖性得分,在 Caltech-256 和 Cifar-100 数据集上的表现优于单类 SVM、k-NN 和 KNFST。

ABSTRACT

We address the problem of novelty detection in multiclass scenarios where some class labels are missing from the training set. Our method is based on the initial assignment of confidence values, which measure the affinity between a new test point and each known class. We first compare the values of the two top elements in this vector of confidence values. In the heart of our method lies the training of an ensemble of classifiers, each trained to discriminate known from novel classes based on some partition of the training data into presumed-known and presumednovel classes. Our final novelty score is derived from the output of this ensemble of classifiers. We evaluated our method on two datasets of images containing a relatively large number of classes - the Caltech-256 and Cifar-100 datasets. We compared our method to 3 alternative methods which represent commonly used approaches, including the one-class SVM, novelty based on k-NN, novelty based on maximal confidence, and the recent KNFST method. The results show a very clear and marked advantage for our method over all alternative methods, in an experimental setup where class labels are missing during training.

研究动机与目标

  • 解决在多类场景中,当训练集中部分类别标签缺失时检测新类别的挑战。
  • 改进现有新颖性检测方法,这些方法专为异常/离群点检测设计,而非缺失类别检测。
  • 开发一种利用置信度分数和随机数据划分学习已知类别与新类别之间判别边界的算法。
  • 在包含数百个类别的大规模图像数据集上评估该方法,且标签覆盖不完整。

提出的方法

  • 该方法首先使用多类分类器,为每个测试样本在所有已知类别上计算软置信度分数。
  • 通过比较两个最高置信度值,形成初始的不确定性度量,该度量作为二分类新颖性检测的输入。
  • 训练 L 个二分类器的集成,每个分类器在训练数据的随机划分(分为预设为已知类与预设为新类)上进行训练。
  • 每个二分类器基于前两名预测的置信度差异,学习区分已知类别与新类别。
  • 最终的新颖性得分由集成模型的聚合输出推导得出,从而实现对新类别的鲁棒检测。
  • 该方法使用 PCA 降维后的特征进行评估,并在 Caltech-256 和 Cifar-100 数据集上进行调优以实现最佳性能。

实验结果

研究问题

  • RQ1在存在缺失标签的多类设置中,基于前两名类别预测的置信度比较能否提升新颖性检测性能?
  • RQ2在随机数据划分上训练二分类器的集成是否能提升新颖性检测性能,相比标准方法?
  • RQ3当训练数据缺少某些类别标签时,所提出的方法在检测新类别方面与 one-class SVM、k-NN 和 KNFST 相比表现如何?
  • RQ4当集成中二分类器数量减少时,该方法的性能会下降到何种程度?
  • RQ5随着缺失类别数量的增加,该方法是否仍能保持性能优势?

主要发现

  • 所提出的方法在 Caltech-256 和 Cifar-100 数据集上检测缺失标签下的新类别时,显著优于 one-class SVM、k-NN 和 KNFST。
  • 在 Caltech-256 上,该方法的性能明显优于所有基线方法,相较于初始置信度得分 θS 提升显著。
  • 在 Cifar-100 上,该方法的最终新颖性得分优于所有替代方法,即使 k-NN 在使用 PCA 降维特征时表现相对较好。
  • 该方法对二分类器数量具有鲁棒性,即使在 L=5 时仍保持强劲性能,且随着 L 减少仅缓慢下降。
  • 随着缺失类别集合的增大,该方法的相对优势进一步提升,表明其在真实世界中标签不完整场景下的可扩展性。
  • 该方法的性能不依赖于特征表示,即使 k-NN 使用了优化的特征空间(如 HOG + PCA),该方法仍表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。