Skip to main content
QUICK REVIEW

[论文解读] UniVSE: Robust Visual Semantic Embeddings via Structured Semantic Representations

Hao Wu, Jiayuan Mao|arXiv (Cornell University)|Apr 11, 2019
Multimodal Machine Learning Applications参考文献 45被引用 4
一句话总结

UniVSE 提出了一种统一的视觉-语义嵌入空间,将文本和视觉概念分解为对象、属性、关系和场景,通过语义成分上的对比学习实现细粒度的跨模态对齐,并通过语义覆盖机制增强鲁棒性。该方法在跨模态检索任务中达到最先进性能,并有效抵御文本域对抗性攻击,同时支持视觉引导的语义解析。

ABSTRACT

We propose Unified Visual-Semantic Embeddings (UniVSE) for learning a joint space of visual and textual concepts. The space unifies the concepts at different levels, including objects, attributes, relations, and full scenes. A contrastive learning approach is proposed for the fine-grained alignment from only image-caption pairs. Moreover, we present an effective approach for enforcing the coverage of semantic components that appear in the sentence. We demonstrate the robustness of Unified VSE in defending text-domain adversarial attacks on cross-modal retrieval tasks. Such robustness also empowers the use of visual cues to resolve word dependencies in novel sentences.

研究动机与目标

  • 建立一个统一的、因子分解的视觉-语义嵌入空间,实现视觉与语言在对象、属性、关系和完整场景层面的对齐。
  • 通过使用对比图像-标题对进行跨情境学习,解决视觉-文本对齐中的指代模糊性问题。
  • 通过在标题编码中强制执行语义覆盖,缓解数据集偏差(如对象共现)的影响。
  • 提升在跨模态检索任务中对文本域对抗性攻击的鲁棒性。
  • 利用视觉线索辅助解析新句子,特别是在解决词依赖关系和语义角色方面。

提出的方法

  • 模型在语义成分(如名词短语、介词短语)上进行对比学习,而非整个句子或图像,从而实现文本短语与视觉区域之间的细粒度对齐。
  • 提出一种新颖的对比样本挖掘策略,识别仅在一个语义成分上不同的图像与标题配对(如“wall”与“shelf”),以解决指代模糊性问题。
  • 在标题编码器中应用语义覆盖正则化,确保句子中的每个语义成分都对全局标题嵌入有实质性贡献。
  • 统一的嵌入空间联合表示视觉区域和文本短语在多个层次上的内容:对象(名词短语)、属性(前置短语)、关系(动词/介词)和完整场景(句子)。
  • 模型计算图像区域与查询嵌入之间的相似度图,以可视化并验证语义成分与对应视觉区域的对齐情况。
  • 在语义解析中,模型利用统一的嵌入空间对可能的依存关系组合(如动词的主语-宾语)进行打分,并基于视觉匹配选择得分最高的组合。

实验结果

研究问题

  • RQ1在语义成分上进行对比学习是否能提升视觉与语言之间的细粒度对齐?
  • RQ2在标题编码中强制执行语义覆盖是否能增强对文本域对抗性扰动的鲁棒性?
  • RQ3来自统一嵌入空间的视觉线索是否能提升在模糊句子中语义解析的准确性?
  • RQ4与端到端的句子级对齐相比,统一的因子分解表示在跨模态检索任务中的表现如何?
  • RQ5视觉信息在多大程度上能解决训练中未见过的新句子中的句法模糊性?

主要发现

  • UniVSE 在所有查询类型(包括单个词、名词短语、关系短语和完整句子)的跨模态检索任务中均达到最先进性能,优于 VSE++、VSE-C 和随机基线模型。
  • 使用所有类型对比组件训练的模型(UniVSE with all)在检索准确率上达到最高,尤其在细粒度查询(如单一名词)上显著优于基线模型。
  • 语义覆盖正则化显著提升了鲁棒性,使 UniVSE 能够抵御使标准模型失效的文本域对抗性攻击。
  • 在结合视觉线索的语义解析中,UniVSE 在带属性对象依存恢复任务上达到 64.82% 的准确率,在关系短语解析任务上达到 62.69%,显著优于 VSE++(41.12% 和 43.31%)与 VSE-C(43.44% 和 41.08%)。
  • 相似度图的可视化结果表明,UniVSE 能够成功将特定语义成分(如“clock”、“wall”)与对应图像区域对齐,证明了其精确的空间定位能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。