Skip to main content
QUICK REVIEW

[论文解读] Exemplar-Centered Supervised Shallow Parametric Data Embedding

Martin Renqiang Min, Hongyu Guo|arXiv (Cornell University)|Feb 21, 2017
Face and Expression Recognition参考文献 15被引用 8
一句话总结

本文提出了一种以样本为中心的高阶参数嵌入(en-HOPE),这是一种监督的浅层参数化模型,通过使用样本而非成对比较来学习线性嵌入函数,实现了线性计算复杂度。在MNIST数据集上,该方法将kNN分类速度提升了最高463倍,同时在基准数据集上的速度和精度均优于最先进的方法(如dt-MCML)。

ABSTRACT

Metric learning methods for dimensionality reduction in combination with k-Nearest Neighbors (kNN) have been extensively deployed in many classification, data embedding, and information retrieval applications. However, most of these approaches involve pairwise training data comparisons, and thus have quadratic computational complexity with respect to the size of training set, preventing them from scaling to fairly big datasets. Moreover, during testing, comparing test data against all the training data points is also expensive in terms of both computational cost and resources required. Furthermore, previous metrics are either too constrained or too expressive to be well learned. To effectively solve these issues, we present an exemplar-centered supervised shallow parametric data embedding model, using a Maximally Collapsing Metric Learning (MCML) objective. Our strategy learns a shallow high-order parametric embedding function and compares training/test data only with learned or precomputed exemplars, resulting in a cost function with linear computational complexity for both training and testing. We also empirically demonstrate, using several benchmark datasets, that for classification in two-dimensional embedding space, our approach not only gains speedup of kNN by hundreds of times, but also outperforms state-of-the-art supervised embedding approaches.

研究动机与目标

  • 解决依赖成对训练比较的传统度量学习方法所面临的二次计算复杂度问题。
  • 通过将kNN比较限制在少量学习或预计算的样本上,而非全部训练数据,从而降低测试成本。
  • 开发一种可扩展、快速且准确的嵌入方法,结合降维与样本压缩,以实现可视化和分类。
  • 证明浅层参数化模型可在标准基准上超越基于深度学习的方法(如dt-MCML)在速度和性能上的表现。

提出的方法

  • 该方法使用最大坍缩度量学习(MCML)目标,学习一个高阶参数化嵌入函数,将数据映射到低维空间。
  • 它用与一组联合学习的样本进行比较,替代了成对训练比较,将训练复杂度降低至线性。
  • 在推理阶段,测试样本仅与这些样本进行比较,从而实现计算成本极低的快速kNN分类。
  • 样本可以是在训练过程中学习得到的,也可以是使用监督k-means聚类在训练数据上预计算得到的。
  • 该模型采用学生t分布来建模嵌入空间中的类间和类内相似性。
  • 通过在损失函数上进行梯度下降优化嵌入函数,该损失函数旨在促进类内坍缩和类间分离。

实验结果

研究问题

  • RQ1浅层参数化模型能否在分类精度和速度上超越基于深度学习的度量学习模型(如dt-MCML)?
  • RQ2基于样本的比较能否将训练和测试复杂度从二次方降低到线性,同时保持性能?
  • RQ3使用k-means中心预计算的样本是否能与学习得到的样本获得相当的结果?
  • RQ4该模型能否在2D空间中实现有效的类内坍缩,以支持可视化,同时保持高分类精度?

主要发现

  • 在MNIST数据集上,en-HOPE相比标准kNN实现了463倍的速度提升,将分类时间从124.97秒减少至0.24秒。
  • 在MNIST上,使用20个学习样本的en-HOPE在2D空间中实现了2.66%的测试误差率,优于标准kNN(3.05%)和SNC(6.31%)在高维空间中的表现。
  • 当使用20个样本将嵌入空间从2D扩展到10D时,en-HOPE的误差率从2.66%降低至2.31%,证明了降维的优势。
  • 在MNIST上,en-HOPE相比dt-MCML实现了316倍的速度提升,同时保持了更优的精度,即使在嵌入计算上也具有2倍的速度优势。
  • 仅使用10个学习样本,en-HOPE在MNIST上仍能实现优异性能(2.66%误差),表明其对样本数量具有鲁棒性。
  • 使用k-means预计算的样本可获得具有竞争力的结果,且该模型在速度和精度上均显著优于SNC,尽管SNC专注于压缩。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。