Skip to main content
QUICK REVIEW

[论文解读] DeepSeek: Content Based Image Search & Retrieval.

Tanya Piplani, David Bamman|arXiv (Cornell University)|Jan 9, 2018
Multimodal Machine Learning Applications参考文献 7被引用 3
一句话总结

本文提出 DeepSeek,一种基于内容的图像检索系统,利用自然语言查询检索语义相关的图像。该系统采用两种方法:基于字幕的检索(使用微调后的 ResNet-101 和 skip-thought 向量)以及通过学习的图像-文本嵌入实现端到端嵌入空间检索;后者在 top-5 检索中达到 91.2% 的精确率,尽管 top-1 精确率较低(68.3%),表明联合嵌入学习在语义图像搜索中的有效性。

ABSTRACT

Most of the internet today is composed of digital media that includes videos and images. With pixels becoming the currency in which most transactions happen on the internet, it is becoming increasingly important to have a way of browsing through this ocean of information with relative ease. YouTube has 400 hours of video uploaded every minute and many million images are browsed on Instagram, Facebook, etc. Inspired by recent advances in the field of deep learning and success that it has gained on various problems like image captioning and, machine translation , word2vec , skip thoughts, etc, we present DeepSeek a natural language processing based deep learning model that allows users to enter a description of the kind of images that they want to search, and in response the system retrieves all the images that semantically and contextually relate to the query. Two approaches are described in the following sections.

研究动机与目标

  • 解决现有图像搜索系统依赖图像查询、有限关键词匹配或元数据所带来的局限,这些方法往往无法捕捉语义含义。
  • 通过将自然语言描述作为输入查询,实现准确且高效的基于内容的图像检索。
  • 通过允许用户使用描述性文本而非要求提供相似图像,克服基于图像检索的根本缺陷。
  • 构建一个统一的嵌入空间,使图像和文本特征在语义上对齐,以提升检索性能。

提出的方法

  • 使用在 MS-COCO 目标检测数据集上预训练的微调 ResNet-101 主干网络,从图像中提取深层卷积特征。
  • 使用在 MS-COCO 数据集上训练的基于长短期记忆网络(LSTM)的语言模型生成图像字幕,以生成语义丰富的文本描述。
  • 使用 skip-thought 模型将生成的字幕和用户查询编码为密集向量表示,以支持语义相似性计算。
  • 通过最小化查询嵌入与数据集中图像字幕嵌入之间的 L2 距离,执行图像检索。
  • 实现一种端到端的嵌入空间检索方法,通过类孪生网络架构将图像及其对应字幕联合嵌入到共享语义空间中。
  • 使用对比损失目标函数优化检索性能,使正样本对在嵌入空间中更接近,负样本对更远离。

实验结果

研究问题

  • RQ1基于文本的查询系统是否能在语义相关性和用户表达力方面优于传统的基于图像或关键词的图像检索?
  • RQ2skip-thought 向量模型在从图像字幕中捕捉语义含义以支持下游检索任务方面的有效性如何?
  • RQ3将图像和字幕联合嵌入到共享空间是否能提升检索准确率,相比仅使用字幕检索?
  • RQ4检索指标的选择(如 precision@1 与 precision@5)在多大程度上能真实反映语义图像检索模型的性能?

主要发现

  • 嵌入空间检索(ESR)方法在 top-5 精确率上达到 91.2%,尽管 top-1 精确率较低(68.3%),仍优于基于字幕的检索(CBR)在 top-5 准确率上的表现。
  • 基于字幕的检索在 top-1 精确率上达到 72.9%,高于基于嵌入的检索(68.3%),表明前者在首个结果的初始排序准确性上更优。
  • skip-thought 模型有效将图像字幕编码为有意义的向量表示,使语义相关的查询与图像之间实现高语义相似性。
  • 该系统在定性表现上表现出色,能够正确检索出既匹配对象存在又符合语义关系的图像(例如:'一只狗正在看电视')。
  • 检索流程未针对 GPU 进行优化,每条查询耗时 1.7–2.1 秒,表明通过硬件加速可实现显著的性能提升。
  • 该模型在 MS-COCO 数据集上使用标准指标(BLEU、METEOR、ROUGE-L、CIDEr)进行了定量评估,结果与当前最先进字幕生成模型相比具有竞争力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。