Skip to main content
QUICK REVIEW

[论文解读] Stochastic Learning of Multi-Instance Dictionary for Earth Mover's Distance based Histogram Comparison

Jihong Fan, Ru‐Ze Liang|arXiv (Cornell University)|Sep 3, 2016
Image Retrieval and Classification Techniques参考文献 1被引用 3
一句话总结

该论文提出了一种基于随机优化的首个EMD最优多实例字典学习方法,采用三元组(基础包、正样本包、负样本包)进行训练,所学习的字典能最小化基于地球移动距离(EMD)比较的合页损失。该方法在医学图像和自然语言处理检索任务中优于现有方法,因其显式优化了基于EMD的直方图相似性。

ABSTRACT

Dictionary plays an important role in multi-instance data representation. It maps bags of instances to histograms. Earth mover's distance (EMD) is the most effective histogram distance metric for the application of multi-instance retrieval. However, up to now, there is no existing multi-instance dictionary learning methods designed for EMD based histogram comparison. To fill this gap, we develop the first EMD-optimal dictionary learning method using stochastic optimization method. In the stochastic learning framework, we have one triplet of bags, including one basic bag, one positive bag, and one negative bag. These bags are mapped to histograms using a multi-instance dictionary. We argue that the EMD between the basic histogram and the positive histogram should be smaller than that between the basic histogram and the negative histogram. Base on this condition, we design a hinge loss. By minimizing this hinge loss and some regularization terms of the dictionary, we update the dictionary instances. The experiments over multi-instance retrieval applications shows its effectiveness when compared to other dictionary learning methods over the problems of medical image retrieval and natural language relation classification.

研究动机与目标

  • 解决缺乏专门针对基于地球移动距离(EMD)的直方图比较进行优化的多实例字典学习方法的问题。
  • 通过采用随机学习框架,克服批量优化在大规模多实例学习中的低效性。
  • 设计一种学习目标,确保基础包与正样本包之间的EMD小于其与负样本包之间的EMD,并设置一个边际。
  • 通过直接对齐字典学习与基于EMD的相似性度量,提升多实例应用中的检索性能。

提出的方法

  • 采用基于三元组的训练框架:一个基础包、一个正样本包(同类别)和一个负样本包(不同类别)。
  • 使用多实例字典将每个包映射为直方图,直方图值由实例与字典之间的相似性得出。
  • 定义合页损失,对基础包与负样本包之间的EMD不比其与正样本包之间的EMD大一个边际的情况施加惩罚。
  • 通过随机梯度下降最小化合页损失加上字典实例的ℓ₂正则化项来优化字典。
  • 利用EMD的线性特性(作为直方图桶的加权和)以在优化过程中实现高效的梯度计算。
  • 通过一次处理一个包三元组的方式应用随机优化,从而实现大规模数据集的可扩展性。

实验结果

研究问题

  • RQ1能否学习到一种专门针对基于EMD的直方图比较进行优化的多实例字典,而非针对分类误差?
  • RQ2随机优化框架是否能提升大规模多实例检索的训练效率?
  • RQ3在EMD距离上使用基于边际的合页损失是否能提升检索性能,相比标准字典学习方法?
  • RQ4基于EMD优化的字典学习是否能在不同领域(如医学影像和自然语言处理)中实现泛化?

主要发现

  • 在DDSM医学图像检索数据集上,所提出的SD-EMD方法在召回率-精确率曲线和ROC曲线上显著优于MMD、DTD、MILES和MILIS。
  • 在SemEval-2010任务8的自然语言关系分类数据集上,SD-EMD再次取得最佳性能,证明其在视觉任务之外也具备泛化能力。
  • SD-EMD的召回率-精确率曲线始终更接近右上角,表明其在精确率与召回率之间具有更优的权衡。
  • SD-EMD的ROC曲线比所有其他方法更接近左上角,证实其在区分正样本包与负样本包方面具有更强的判别能力。
  • 该方法的性能提升归因于对基于EMD的相似性进行了直接优化,而这一因素在现有字典学习方法中未被考虑。
  • 随机优化使大规模数据集上的高效训练成为可能,避免了批量处理带来的计算负担。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。