Skip to main content
QUICK REVIEW

[论文解读] LEWIS: Latent Embeddings for Word Images and their Semantics

Albert Gordo, Jon Almazán|arXiv (Cornell University)|Sep 21, 2015
Multimodal Machine Learning Applications参考文献 24被引用 6
一句话总结

LEWIS 提出一种基于 CNN 的模型,直接从文字图像预测语义概念,无需转录,通过加权排序损失将图像和概念嵌入共享潜在空间。该方法在零样本泛化中实现高准确率(最高达 95% mAP),通过端到端学习从像素到概念的语义,优于基于转录的基线方法。

ABSTRACT

The goal of this work is to bring semantics into the tasks of text recognition and retrieval in natural images. Although text recognition and retrieval have received a lot of attention in recent years, previous works have focused on recognizing or retrieving exactly the same word used as a query, without taking the semantics into consideration. In this paper, we ask the following question: \emph{can we predict semantic concepts directly from a word image, without explicitly trying to transcribe the word image or its characters at any point?} For this goal we propose a convolutional neural network (CNN) with a weighted ranking loss objective that ensures that the concepts relevant to the query image are ranked ahead of those that are not relevant. This can also be interpreted as learning a Euclidean space where word images and concepts are jointly embedded. This model is learned in an end-to-end manner, from image pixels to semantic concepts, using a dataset of synthetically generated word images and concepts mined from a lexical database (WordNet). Our results show that, despite the complexity of the task, word images and concepts can indeed be associated with a high degree of accuracy

研究动机与目标

  • 为了实现对文字图像的语义理解,超越精确的词汇匹配,特别是在城市场景理解中的应用。
  • 为了解决依赖不完美转录和词汇外词汇处理的两步法方法的局限性。
  • 学习一个紧凑的、共享的嵌入空间,使文字图像与语义概念能够联合表示。
  • 通过共享表示利用语义相似性,实现在未见词汇上的零样本泛化。
  • 为未来研究生成大规模、语义标注的合成文字图像数据集。

提出的方法

  • 使用加权排序损失训练深度卷积神经网络(CNN),确保对于给定的文字图像,相关语义概念的排名高于无关概念。
  • 该模型学习两个嵌入函数:一个用于文字图像(通过 FC7 层),一个用于语义概念(通过 FC8 层),两者均映射到共享的 D 维欧几里得空间。
  • 最后一层的权重作为已知概念的归纳嵌入,而 FC7 层则为未见文字图像提供归纳嵌入。
  • 网络在合成生成的文字图像与从 WordNet 中挖掘的语义概念配对数据上进行端到端训练。
  • 特征经过 L2 归一化以用于检索任务中的相似性计算,使用点积进行匹配。
  • 该方法支持语义查询及概念向量的加法/减法操作,以实现复杂搜索。

实验结果

研究问题

  • RQ1是否可以不经过显式转录,直接从文字图像像素预测语义概念?
  • RQ2深度 CNN 是否能够学习一个共享嵌入空间,使文字图像与语义概念在语义上对齐?
  • RQ3该模型在训练中未见过的词汇上的泛化能力如何?
  • RQ4在特征空间中直接学习语义是否优于基于单词转录的两步法?
  • RQ5通过概念嵌入的向量运算,模型是否能够支持复杂的语义查询?

主要发现

  • 当使用语义目标进行训练时,LEWIS 在图像到概念任务上达到 95% 的平均平均精度(mAP),而使用 CNN-Dict 7 特征的两步基线方法仅达到 59%。
  • 该模型在未见词汇上表现出强大的零样本泛化能力,mAP 分别达到 56.1%(K=128, l=7)和 61.9%(K=256, l=7)。
  • 图像到图像的检索结果表明,LEWIS 在更高 k 排名下仍保持高性能,而 CNN-Dict 7 特征在 k>1 后迅速下降,因其专注于精确的单词匹配。
  • 定性结果表明,语义上相似的概念在潜在空间中被嵌入到相邻区域,即使这些概念未在真实标签中出现。
  • 概念向量运算(如加法/减法)可实现有意义的复杂查询,例如通过组合 'restaurant' 和 'food' 向量来检索与 'pizzeria' 相关的图像。
  • 该模型能够成功检索出具有不同转录形式但共享语义的图像,证明了其对视觉变化的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。