Skip to main content
QUICK REVIEW

[论文解读] Deep Divergence Learning

Kubra Cilingir, Rachel Manzelli|OpenBU (Boston University)|May 6, 2020
Gaussian Processes and Bayesian Inference参考文献 32被引用 6
一句话总结

本文提出深度Bregman散度,这是一种统一框架,将深度度量学习与函数型Bregman散度相结合,通过神经网络学习非欧几里得、分布感知的距离度量。该方法在基准分类、聚类和无监督生成任务中实现了最先进或具有竞争力的性能,通过学习超越标准欧几里得度量的非对称散度实现。

ABSTRACT

Classical linear metric learning methods have recently been extended along two distinct lines: deep metric learning methods for learning embeddings of the data using neural networks, and Bregman divergence learning approaches for extending learning Euclidean distances to more general divergence measures such as divergences over distributions. In this paper, we introduce deep Bregman divergences, which are based on learning and parameterizing functional Bregman divergences using neural networks, and which unify and extend these existing lines of work. We show in particular how deep metric learning formulations, kernel metric learning, Mahalanobis metric learning, and moment-matching functions for comparing distributions arise as special cases of these divergences in the symmetric setting. We then describe a deep learning framework for learning general functional Bregman divergences, and show in experiments that this method yields superior performance on benchmark datasets as compared to existing deep metric learning approaches. We also discuss novel applications, including a semi-supervised distributional clustering problem, and a new loss function for unsupervised data generation.

研究动机与目标

  • 将深度度量学习与Bregman散度学习统一为一个可微的统一框架,用于通用度量学习。
  • 利用神经网络学习非欧几里得、基于分布的散度,以提升下游任务性能。
  • 将深度度量学习扩展至欧几里得距离之外,以处理概率分布之间的比较。
  • 在半监督分布聚类和无监督数据生成中开发新颖应用,利用学习到的散度。
  • 证明非对称深度Bregman散度在标准基准上优于对称版本。

提出的方法

  • 使用深度神经网络参数化Bregman散度的生成凸泛函,实现散度的端到端学习。
  • 将函数型Bregman散度作为经典Bregman散度的推广,用于函数输入,从而实现对分布的比较。
  • 在学习到的深度Bregman散度上应用标准深度度量学习目标(三元组损失和对比损失)以训练网络。
  • 设计一种类似GAN的框架,其中判别器学习真实数据与生成数据之间的深度Bregman散度,而生成器则最小化该散度。
  • 使用贝叶斯优化在多个数据集上调整学习率、网络深度和批量大小等超参数。
  • 实现一种半监督分布聚类方法,利用成对监督指导分布数据点的聚类。

实验结果

研究问题

  • RQ1能否使用深度神经网络学习超越欧几里得距离的一般函数型Bregman散度?
  • RQ2在分类准确率方面,深度Bregman散度与标准深度度量学习方法相比如何?
  • RQ3深度Bregman散度能否提升半监督分布聚类任务的性能?
  • RQ4学习到的深度Bregman散度能否作为无监督数据生成的有效损失函数,媲美GAN?
  • RQ5非对称深度Bregman散度是否在多个学习场景中带来可测量的性能提升?

主要发现

  • 所提出的深度Bregman散度框架在MNIST、CIFAR10、SVHN、STL10和Fashion MNIST上实现了比标准深度度量学习更小但显著的准确率提升,尤其在三元组损失下表现更优。
  • 在无数据增强的Fashion MNIST上,该方法实现了94.23%的准确率,超越了该设置下的当前最先进水平。
  • 在人体活动传感器数据集和一个概念验证数据集上,该方法在半监督分布聚类任务中优于现有基线。
  • 定性结果表明,学习到的散度可实现与GAN相当的CelebA和MNIST真实图像生成效果,且基于对比损失进行训练。
  • 该框架自然地涵盖了现有方法,如马氏距离学习、核度量学习,以及MMD和Wasserstein距离等矩匹配函数。
  • 实证结果表明,通过深度Bregman散度学习到的非对称散度在多种学习场景中优于对称模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。