Skip to main content
QUICK REVIEW

[论文解读] Classification by Set Cover: The Prototype Vector Machine

Jacob Bien, Robert Tibshirani|ArXiv.org|Aug 17, 2009
Machine Learning and Algorithms参考文献 11被引用 10
一句话总结

该论文提出了原型向量机(PVM),一种新颖的最近原型分类器,将原型选择建模为集合覆盖问题,以在保持高分类准确率的同时最小化原型数量。在ZIP码数据集上,PVM使用少于一半的训练样本即优于1-NN;在蛋白质和UCI数据集上,PVM实现了显著的原型压缩,同时保持了具有竞争力的性能,提供了一种基于实际训练样本、稀疏且可解释的模型。

ABSTRACT

We introduce a new nearest-prototype classifier, the prototype vector machine (PVM). It arises from a combinatorial optimization problem which we cast as a variant of the set cover problem. We propose two algorithms for approximating its solution. The PVM selects a relatively small number of representative points which can then be used for classification. It contains 1-NN as a special case. The method is compatible with any dissimilarity measure, making it amenable to situations in which the data are not embedded in an underlying feature space or in which using a non-Euclidean metric is desirable. Indeed, we demonstrate on the much studied ZIP code data how the PVM can reap the benefits of a problem-specific metric. In this example, the PVM outperforms the highly successful 1-NN with tangent distance, and does so retaining fewer than half of the data points. This example highlights the strengths of the PVM in yielding a low-error, highly interpretable model. Additionally, we apply the PVM to a protein classification problem in which a kernel-based distance is used.

研究动机与目标

  • 开发一种稀疏且可解释的分类器,通过使用最少数量的代表性原型来总结大规模训练数据集。
  • 通过将原型选择建模为组合优化问题,解决1-NN及其他原型方法的局限性。
  • 在基于原型的分类中支持非欧几里得或问题特定的相异度量。
  • 根据数据复杂性和类间分离程度,自动确定每类最优的原型数量。
  • 通过确保原型为实际的训练样本而非合成或平均点,提升可解释性。

提出的方法

  • PVM将原型选择建模为集合覆盖问题的一种变体,其中原型必须在半径ε内覆盖所有训练样本。
  • 它使用相异度矩阵D定义覆盖范围,αj为原型包含的二值指示变量(若选择zj,则αj = 1)。
  • 整数规划模型最小化∑αj,受约束于对每个训练样本xi,∑αj ≥ 1,确保每个样本至少与一个原型的距离在ε以内。
  • 提出两种近似算法以高效求解NP难的整数规划问题:一种基于贪心集合覆盖,另一种采用带松弛项的公式化方法。
  • 分类规则将新样本分配给其最近原型(按相异度)所属的类别。
  • 该方法支持任意相异度量,包括非欧几里得和基于核的距离,使其适用于复杂数据空间。

实验结果

研究问题

  • RQ1能否将基于原型的分类器建模为集合覆盖问题,以同时实现高准确率与稀疏性?
  • RQ2当使用特定问题的相异度量(如数字图像中的切线距离)时,PVM相较于1-NN和K-中位数的性能如何?
  • RQ3PVM能否在无需人工调参的情况下自动选择每类合适的原型数量?
  • RQ4PVM在减少原型数量的同时是否能保持或提升分类准确率,特别是在类别不平衡的数据集中?
  • RQ5在实际应用中,使用实际训练样本作为原型在多大程度上提升了可解释性?

主要发现

  • 在ZIP码数据集上,PVM使用少于一半的训练样本作为原型,其测试误差低于1-NN(使用切线距离),表现更优。
  • 在蛋白质数据集上,PVM实现了10折交叉验证的最低误差率1.76%,与调优后的SVM性能相当,但仅选择了933个原型。
  • 在UCI糖尿病数据集上,PVM使用仅12个原型即达到24.2%的测试误差,而1-NN使用512个原型,且保持了具有竞争力的准确率。
  • 在玻璃数据集上,PVM将误差从1-NN的38.0%降低至36.6%,使用34个原型,展现了更高的效率且未牺牲准确率。
  • 在音素数据集上,PVM与1-NN保持相同的2.8%误差率,原型数从352个减少至352个(与1-NN相同),但其性能优于LVQ(19.9%误差),且使用更少原型。
  • 在蛋白质数据集中,PVM为正类选择了26个原型,为负类选择了907个原型,反映出类别的不平衡与复杂性,展示了自适应原型选择能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。