Skip to main content
QUICK REVIEW

[论文解读] Learning High-level Image Representation for Image Retrieval via Multi-Task DNN using Clickthrough Data

Yalong Bai, Kuiyuan Yang|arXiv (Cornell University)|Dec 17, 2013
Advanced Image and Video Retrieval Techniques参考文献 13被引用 10
一句话总结

本文提出一种采用环状训练(ring training)的多任务深度神经网络(DNN),通过点击数据学习高层图像表征,以缓解图像检索中查询与图像之间的语义鸿沟。通过在查询间共享特征提取层,并使用查询特定的层进行相关性评分,该方法在真实世界图像检索基准上实现了最先进性能,优于二值和多分类DNN基线模型。

ABSTRACT

Image retrieval refers to finding relevant images from an image database for a query, which is considered difficult for the gap between low-level representation of images and high-level representation of queries. Recently further developed Deep Neural Network sheds light on automatically learning high-level image representation from raw pixels. In this paper, we proposed a multi-task DNN learned for image retrieval, which contains two parts, i.e., query-sharing layers for image representation computation and query-specific layers for relevance estimation. The weights of multi-task DNN are learned on clickthrough data by Ring Training. Experimental results on both simulated and real dataset show the effectiveness of the proposed method.

研究动机与目标

  • 解决图像检索中高层查询与低层图像特征之间的语义鸿沟问题。
  • 利用大规模点击数据(包含数百万个查询和点击图像)进行图像表征的监督学习。
  • 克服二值和多分类DNN在处理大规模、长尾查询分布及重叠概念时的局限性。
  • 开发一种可扩展、可迁移的深度学习框架,实现查询间视觉表征共享,同时适应查询特定的相关性。
  • 通过一种新颖的训练策略——环状训练,联合优化共享权重与查询特定权重,提升图像检索排序性能。

提出的方法

  • 该模型采用多任务DNN架构,包含两个组件:用于共享图像特征提取的查询共享层,以及用于相关性评分的查询特定层。
  • 相关性得分计算公式为 $ r(I,q) = \psi(\phi(I;W_s);W_q) $,其中 $ \phi $ 负责提取图像特征,$ \psi $ 使用查询特定权重计算相关性。
  • 目标函数通过最小化点击数据上的分类损失实现:$ \min_{\Theta} J(\Theta) = \frac{1}{N} \sum_{i=1}^{M} \sum_{j=1}^{n_i} L(g(I_j^i,q_i), r(I_j^i,q_i)) $。
  • 引入环状训练作为联合优化方法,交替更新共享权重 $ W_s $ 和查询特定权重 $ W_{q_i} $,从而提升泛化能力与收敛性。
  • 环状训练完成后,提取共享层的特征,并将其作为输入送入SVM以进行最终的相关性排序。
  • 网络架构包含五个卷积层、两个全连接层、ReLU激活函数、最大池化和响应归一化,输入尺寸为 $ 224 \times 224 $。

实验结果

研究问题

  • RQ1多任务DNN架构能否有效从点击数据中学习高层图像表征,以弥合图像检索中的语义鸿沟?
  • RQ2环状训练如何提升在大规模、长尾点击数据集上共享权重与查询特定权重的学习效果?
  • RQ3所提出的方法是否在图像检索排序性能上优于二值和多分类DNN基线模型?
  • RQ4跨查询的共享特征学习在多大程度上提升了泛化能力,特别是对罕见或尾部查询?
  • RQ5该模型能否在包含数百万查询和重尾分布的真实世界图像检索任务中实现良好泛化?

主要发现

  • 所提出的多任务DNN结合环状训练在MSR-Bing测试集上取得了0.502的DCG25得分,优于随机排序(0.468)和基于SIFT的SVM(0.484)。
  • 在模拟数据集上,该方法将平均精度均值降低了32.36%(数据集1)、30.4%(数据集2)和36.68%(数据集3),表明其在二值和多分类基线模型上具有持续优势。
  • 环状训练实现了共享与查询特定权重的有效联合优化,提升了收敛性与性能,尤其在训练数据有限的尾部查询上表现更优。
  • 该模型有效处理了点击数据的长尾分布,其中超过96%的查询点击图像少于1,000张,而多分类DNN在大规模场景下不可行。
  • 通过多任务DNN学习到的视觉特征比SIFT特征更具判别性,这一点在基于SVM的评估中表现更优。
  • 该架构在真实世界数据上展现出鲁棒性与可扩展性,最终模型在MSR-Bing图像检索挑战数据集上达到了最先进性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。