Skip to main content
QUICK REVIEW

[论文解读] ADVISE: Symbolism and External Knowledge for Decoding Advertisements

Keren Ye, Adriana Kovashka|arXiv (Cornell University)|Nov 17, 2017
Multimodal Machine Learning Applications被引用 3
一句话总结

ADVISE 提出了一种视觉-语言表征模型,通过利用符号关联(例如,枪 = 危险,摩托车 = 冒险)以及来自目标检测和图像字幕的外部知识,提升对公共宣传广告(PSA)和商业广告的理解。通过将符号标签和目标检测预测作为联合图像-文本嵌入空间中的约束条件和加性组件,该方法在广告理解任务上相比最先进方法实现了21%的相对性能提升,并在标语检索和聚类任务中展现出强大的零样本性能。

ABSTRACT

In order to convey the most content in their limited space, advertisements embed references to outside knowledge via symbolism. For example, a motorcycle stands for adventure (a positive property the ad wants associated with the product being sold), and a gun stands for danger (a negative property to dissuade viewers from undesirable behaviors). We show how to use symbolic references to better understand the meaning of an ad. We further show how anchoring ad understanding in general-purpose object recognition and image captioning improves results. We formulate the ad understanding task as matching the ad image to human-generated statements that describe the action that the ad prompts, and the rationale it provides for taking this action. Our proposed method outperforms the state of the art on this task, and on an alternative formulation of question-answering on ads. We show additional applications of our learned representations for matching ads to slogans, and clustering ads according to their topic, without extra training.

研究动机与目标

  • 通过建模符号引用和外部知识,提升对广告——尤其是概念上复杂的公共宣传广告(PSA)——的理解。
  • 通过结合符号映射和目标级识别的视觉-语义嵌入,解决广告中非字面、修辞性信息的解码挑战。
  • 证明将符号知识与现代目标检测和注意力机制相结合,可超越传统视觉-语义嵌入方法的性能。
  • 展示 ADVISE 学习到的表征可泛化至零样本任务,如标语检索和基于主题的聚类,而无需额外训练。

提出的方法

  • 该方法学习一个联合图像-文本嵌入空间,将广告图像映射到描述其意图行为和理由的语句,使用三元组排序损失进行优化。
  • 图像表征基于通过区域提议网络(如 Faster R-CNN)提取的区域特征构建,注意力机制为每个区域分配重要性权重。
  • 符号关联(如“枪”→“危险”)被用作约束条件,以正则化嵌入空间,确保具有相似符号意义的图像在嵌入空间中更接近。
  • 通过领域特定知识库将目标检测预测映射到符号概念,利用该知识对图像表征进行加性增强。
  • 将噪声图像字幕作为外部知识来源,将字幕中的词语传播到图像区域,以改善语义对齐。
  • 最终的图像表征结合了区域特征、基于符号的约束条件以及知识增强的嵌入,从而实现对下游任务的鲁棒零样本迁移。

实验结果

研究问题

  • RQ1符号关联(如枪象征危险)能否被有效利用,以提升对公共宣传广告中非字面、概念性信息的理解?
  • RQ2将来自目标检测和图像字幕的外部知识整合到视觉-语义嵌入中,如何提升广告理解任务的性能?
  • RQ3符号约束和知识增强的图像表征在多大程度上能泛化至零样本任务,如标语检索和主题聚类?
  • RQ4与传统识别流水线相比,使用现代目标识别技术(如区域提议和注意力机制)是否显著提升了广告理解能力?

主要发现

  • 在广告理解的主要任务——将广告与人类生成的描述其信息和理由的语句进行匹配——中,ADVISE 相比最先进方法实现了21%的性能提升。
  • 在问答分类任务中,ADVISE 在 PSAs 上达到10.94%的 top-1 准确率,在产品广告上达到12.64%,分别比之前最先进方法高出9%和6%。
  • 在困难语句检索任务中,ADVISE 的排名为4.827(±0.025),显著优于 VSE++(5.635)和 Hussain-Ranking(5.595),表明其具备优越的零样本泛化能力。
  • 在标语检索任务中,ADVISE 的排名为3.331(±0.077),显著优于次佳方法,表明其学习到的表征具有极强的可迁移性。
  • 在基于主题的聚类任务中,ADVISE 的同质性评分为0.355(±0.001),显著高于 VSE++(0.292)和 Hussain-Ranking(0.291),表明其在按主题聚类广告方面具有更优的语义聚类能力。
  • 该方法表明,概念性知识(符号)对 PSAs 更有益,而通用目标识别对产品广告更有效,凸显了外部知识源在不同任务中的特定适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。