Skip to main content
QUICK REVIEW

[论文解读] Learning to Approximate a Bregman Divergence

Ali Siahkamari, Xide Xia|OpenBU (Boston University)|May 28, 2019
Statistical Mechanics and Entropy参考文献 31被引用 7
一句话总结

该论文提出了一种通过使用分段线性函数近似其底层的凸生成函数来学习任意Bregman散度的方法,从而将马哈拉诺比斯度量学习推广到非线性散度。该方法实现了 $\mathcal{O}_p(m^{-1/2})$ 的泛化误差,与线性方法的理论边界一致,并在UCI基准数据集的聚类和排序任务中优于现有基线方法。

ABSTRACT

Bregman divergences generalize measures such as the squared Euclidean distance and the KL divergence, and arise throughout many areas of machine learning. In this paper, we focus on the problem of approximating an arbitrary Bregman divergence from supervision, and we provide a well-principled approach to analyzing such approximations. We develop a formulation and algorithm for learning arbitrary Bregman divergences based on approximating their underlying convex generating function via a piecewise linear function. We provide theoretical approximation bounds using our parameterization and show that the generalization error $O_p(m^{-1/2})$ for metric learning using our framework matches the known generalization error in the strictly less general Mahalanobis metric learning setting. We further demonstrate empirically that our method performs well in comparison to existing metric learning methods, particularly for clustering and ranking problems.

研究动机与目标

  • 开发一种从监督数据中学习任意Bregman散度的系统性框架,突破线性度量学习的局限。
  • 解决通过可理论分析和实际优化的方式参数化Bregman散度背后凸函数类的挑战。
  • 在保持强理论保证(如泛化误差界)的同时,将马哈拉诺比斯度量学习推广到非线性散度。
  • 在聚类、排序和k近邻分类任务上实证验证该方法,证明其在性能上优于线性和非线性基线方法。

提出的方法

  • 该方法使用最大仿射(分段线性)函数 $h(\mathbf{x}) = \max_{k \in [K]} \mathbf{a}_k^T \mathbf{x} + b_k$ 参数化Bregman散度的凸生成函数 $\phi$。
  • 然后将Bregman散度近似为 $D_h(\mathbf{x}_1, \mathbf{x}_2) = h(\mathbf{x}_1) - h(\mathbf{x}_2) - \nabla h(\mathbf{x}_2)^T (\mathbf{x}_1 - \mathbf{x}_2)$,其中梯度通过次梯度计算。
  • 该框架可通过相对比较或相似/不相似对等监督信号进行学习,采用凸优化方法。
  • 理论分析表明,通过该参数化方式近似Bregman散度的误差为 $\mathcal{O}(K^{-1/d})$,其中 $d$ 为输入维度。
  • 泛化误差被限制在 $\mathcal{O}_p(m^{-1/2})$,与马哈拉诺比斯度量学习的已知边界一致。
  • 该方法被实现为一个灵活的框架——PBDL(分段线性Bregman散度学习),适用于聚类、排序和最近邻分类任务。

实验结果

研究问题

  • RQ1分段线性函数能否为近似任意Bregman散度提供理论基础充分且有效的参数化?
  • RQ2所提出的框架是否能达到与成熟且广泛使用的马哈拉诺比斯度量学习设置相当的泛化误差?
  • RQ3在聚类和排序任务中,该方法与现有线性和非线性度量学习基线相比表现如何?
  • RQ4该方法能否有效建模马哈拉诺比斯学习无法捕捉的非线性散度?

主要发现

  • 所提出的PBDL方法实现了 $\mathcal{O}_p(m^{-1/2})$ 的泛化误差,与马哈拉诺比斯度量学习设置的理论边界一致。
  • 通过分段线性函数近似Bregman散度的误差被限制在 $\mathcal{O}(K^{-1/d})$ 以内,表明随着线性分段数量的增加,误差收敛。
  • 在30个UCI基准数据集上,PBDL在聚类、排序和k-NN准确率任务中30次比较中有22次获得第一或第二名,优于线性和非线性基线方法。
  • 在聚类和排序任务中,PBDL实现了94.5%的平均Rand指数和93.5%的AUC,显著优于ITML和LMNN在多个数据集上的表现。
  • 在Wine数据集上,PBDL实现了96.5%的k-NN准确率,优于所有其他方法,包括GMML和Kernel NCA。
  • 实证结果表明,PBDL能有效建模线性方法(如ITML)无法捕捉的复杂非线性数据结构,这在合成散度拟合实验中已得到验证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。