Skip to main content
QUICK REVIEW

[论文解读] Metric and Kernel Learning using a Linear Transformation

Prateek Jain, Brian Kulis|ArXiv.org|Oct 30, 2009
Face and Expression Recognition参考文献 27被引用 12
一句话总结

该论文提出了一种可扩展的度量学习与核学习方法,通过使用LogDet散度学习输入数据的线性变换,实现高效的核化和样本外泛化。该方法可推广至高维空间,并在视觉与文本分类任务中优于现有最先进方法。

ABSTRACT

Metric and kernel learning are important in several machine learning applications. However, most existing metric learning algorithms are limited to learning metrics over low-dimensional data, while existing kernel learning algorithms are often limited to the transductive setting and do not generalize to new data points. In this paper, we study metric learning as a problem of learning a linear transformation of the input data. We show that for high-dimensional data, a particular framework for learning a linear transformation of the data based on the LogDet divergence can be efficiently kernelized to learn a metric (or equivalently, a kernel function) over an arbitrarily high dimensional space. We further demonstrate that a wide class of convex loss functions for learning linear transformations can similarly be kernelized, thereby considerably expanding the potential applications of metric learning. We demonstrate our learning approach by applying it to large-scale real world problems in computer vision and text mining.

研究动机与目标

  • 解决传统马氏距离学习方法在高维数据上扩展性差且缺乏对新数据点泛化能力的局限性。
  • 通过将线性变换核化,克服大多数核学习方法的归纳性质,实现对样本外数据点的泛化能力。
  • 为高维特征空间中学习线性变换开发一种可扩展的优化框架,使用凸损失函数,特别是LogDet散度。
  • 将该框架扩展至一类广泛的凸损失函数,实现灵活且通用的度量/核学习,同时保持计算效率和样本外能力。
  • 在计算机视觉与文本挖掘的大规模真实世界问题中,展示所提方法的有效性,证明其在现有最先进技术上的一致性改进。

提出的方法

  • 将度量学习表述为学习输入数据的线性变换,其中马氏距离定义为 $ d_A(\mathbf{x}_i, \mathbf{x}_j) = \| A\phi(\mathbf{x}_i) - A\phi(\mathbf{x}_j) \|^2 $,其中 $ A $ 通过优化学习得到。
  • 使用LogDet散度作为损失函数,以学习正定变换矩阵 $ W $,通过自然强制正定性简化优化过程。
  • 应用Bregman投影高效求解优化问题,实现对数百万数据点的可扩展性。
  • 通过将学习到的核表示为 $ \phi(\mathbf{x})^T W \phi(\mathbf{y}) $,实现学习过程的核化,使方法能够泛化至未见数据点。
  • 通过类似表示定理的方式,以训练数据点表示学习到的变换 $ W $,从而实现对任意测试实例的核值评估。
  • 将变换限制在数据的低秩基上,以在不牺牲性能的前提下,将方法扩展至高维特征空间。

实验结果

研究问题

  • RQ1能否在高维特征空间中,使用如LogDet散度这样的凸损失函数,高效学习输入数据的线性变换?
  • RQ2线性变换学习过程的核化是否能实现对样本外数据点的泛化,从而克服先前核学习方法的归纳性局限?
  • RQ3所提框架能否扩展至LogDet以外的其他凸损失函数?在何种条件下可确保高效核化?
  • RQ4在计算机视觉与文本分类等真实应用场景中,所学度量或核函数的性能与基线方法相比如何?
  • RQ5该方法在保持高精度和未见数据高效推理的前提下,能在多大程度上扩展至大规模数据集?

主要发现

  • 所提出的基于LogDet的线性变换方法在TREC数据集上,使用 $ T=30 $ 时达到62.1%的1-NN分类准确率,显著优于基线核函数。
  • 所学习的SUM核在TREC数据集上,使用 $ T=15 $ 时达到73.7%的准确率,证明其在1-NN和SVM分类器中优于标准核函数。
  • 在Classic3文本数据集上,该方法优于标准欧氏距离和潜在语义分析(LSA),且随着基维数增加,优势更加明显。
  • 在20-Newsgroups数据集上,该方法在所有测试基尺寸下均优于基线方法,且随着基维数增加,性能提升保持一致。
  • 由于通过类似表示定理对线性变换进行核化,该方法能有效泛化至未见数据,而传统归纳核学习方法则不能。
  • 该框架可扩展至大规模数据集,优化算法能高效处理数百万数据对象的规模。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。