Skip to main content
QUICK REVIEW

[论文解读] Don't only Feel Read: Using Scene text to understand advertisements

Arka Ujjal Dey, Suman K. Ghosh|arXiv (Cornell University)|Jun 21, 2018
Video Analysis and Summarization参考文献 17被引用 5
一句话总结

本文提出了一种用于广告图像分类的多模态框架,结合来自深度卷积神经网络(CNN)的视觉特征与通过现成识别模型从场景文本中提取的文本特征。通过使用拼接或多模态双线性池化(MCB)的方式融合这些模态,该方法显著提升了分类准确率——在使用MCB融合时,主题分类准确率达到了58%,表明场景文本为视觉内容提供了关键且互补的语义线索。

ABSTRACT

We propose a framework for automated classification of Advertisement Images, using not just Visual features but also Textual cues extracted from embedded text. Our approach takes inspiration from the assumption that Ad images contain meaningful textual content, that can provide discriminative semantic interpretetion, and can thus aid in classifcation tasks. To this end, we develop a framework using off-the-shelf components, and demonstrate the effectiveness of Textual cues in semantic Classfication tasks.

研究动机与目标

  • 探究广告中嵌入的场景文本是否能为图像理解提供有意义的语义线索。
  • 评估从场景文本中提取的文本特征在提升图像分类性能方面的有效性。
  • 比较简单的融合方法(如拼接)与更具表现力的方案(如MCB)在结合视觉与文本特征时的性能差异。
  • 分析在模糊或象征性广告图像中,视觉与文本线索的互补性质。
  • 证明即使转录结果不完美,场景文本也能显著增强对广告的语义理解。

提出的方法

  • 使用Textboxes [12] 和 Jaderberg [6] 的流水线进行文本检测与识别,从广告图像中提取场景文本。
  • 选取置信度最高的k个文本词,并将其嵌入300维的word2vec向量,再通过求和形成全局文本特征表示。
  • 利用预训练的GoogLeNet网络提取视觉特征,以最后一层全连接层的1024维激活值作为全局图像特征。
  • 评估两种融合策略:(1) 特征拼接,(2) 多模态双线性池化(MCB),后者用于建模图像与文本特征之间的非线性交互。
  • 通过计数草图(count sketch)的低秩近似方法,使MCB计算高效且可扩展。
  • 该框架在包含47,000张广告图像的精选数据集上进行评估,其转录结果可靠(置信度≥70%)。

实验结果

研究问题

  • RQ1广告中的场景文本是否能提供超越纯视觉特征的判别性语义信息,从而提升图像分类性能?
  • RQ2在结合视觉与文本特征时,拼接与MCB等不同融合策略对分类准确率的影响如何?
  • RQ3在模糊或隐喻性广告图像中,场景文本的文本特征在多大程度上与视觉线索互补或取代视觉线索?
  • RQ4在特征聚合中,使用不同数量的top-k文本词时,系统性能如何变化?
  • RQ5一个简单、现成的文本提取与嵌入流水线,是否能显著提升对广告图像的语义理解?

主要发现

  • 仅使用最自信的前5个词的文本特征,模型在40类主题分类任务中达到45%的准确率,表明仅靠场景文本本身即蕴含丰富的语义信息。
  • 通过拼接融合图像与文本特征,准确率提升至53%,表明两种模态均对分类有显著贡献。
  • MCB融合策略优于拼接,当k=5时准确率达到58%,表明模态间乘法交互能捕捉更丰富的语义关系。
  • MCB融合在不同k值(5、35、100)下表现稳定,k=35和k=100时准确率分别为57%,表明对所用词数具有鲁棒性。
  • 在视觉问答(VQA)任务中,通过MCB融合图像、文本与问题特征,准确率提升至12.44%,表明该框架在分类任务之外也具备良好的泛化能力。
  • 研究指出,转录错误与词汇限制仍是主要瓶颈,这为未来研究提供了方向:探索无需中间识别步骤的端到端像素到嵌入学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。