Skip to main content
QUICK REVIEW

[论文解读] Weakly supervised cross-domain alignment with optimal transport

Siyang Yuan, Ke Bai|arXiv (Cornell University)|Aug 14, 2020
Multimodal Machine Learning Applications参考文献 64被引用 5
一句话总结

本文提出一种基于最优传输(OT)的弱监督跨域对齐方法,用于在无需显式实体或对应关系标注的情况下,学习细粒度的图文语义相似性。通过将最优传输公式化为特征匹配的可微正则化项,该方法在视觉-语言任务中提升了性能,使更简单的模型在检索和短语定位基准上超越更复杂的架构。

ABSTRACT

Cross-domain alignment between image objects and text sequences is key to many visual-language tasks, and it poses a fundamental challenge to both computer vision and natural language processing. This paper investigates a novel approach for the identification and optimization of fine-grained semantic similarities between image and text entities, under a weakly-supervised setup, improving performance over state-of-the-art solutions. Our method builds upon recent advances in optimal transport (OT) to resolve the cross-domain matching problem in a principled manner. Formulated as a drop-in regularizer, the proposed OT solution can be efficiently computed and used in combination with other existing approaches. We present empirical evidence to demonstrate the effectiveness of our approach, showing how it enables simpler model architectures to outperform or be comparable with more sophisticated designs on a range of vision-language tasks.

研究动机与目标

  • 解决在弱监督设定下图像与文本之间跨域对齐(CDA)的挑战,其中既无实体标注也无其对应关系标注。
  • 开发一种原理清晰、可微的算法,用于学习图像与文本实体之间的细粒度语义相似性,且无需强监督标注。
  • 通过统一的OT基础正则化项,提升图像-文本检索、短语定位和视觉问答等视觉-语言任务的性能。
  • 证明基于OT的对齐方法可超越或匹配最先进模型,同时支持更简单的模型架构。

提出的方法

  • 将跨域对齐建模为使用最优传输(OT)计算图像与文本特征之间传输计划的二部图匹配问题。
  • 在损失函数中引入OT作为可微正则化项,支持使用标准深度学习框架进行端到端训练。
  • 采用OT的对偶形式,高效计算图像与文本嵌入之间的传输代价,并利用Sinkhorn近似方法提升可扩展性。
  • 将OT正则化项同时应用于图像和文本编码器,实现特征表示与对齐的联合优化。
  • 将最优传输计划T作为可解释的注意力类似矩阵,提供稀疏且自归一化的对齐结果。
  • 将OT正则化项集成至现有模型(如SCAN和双线性注意力网络),在不改变架构的前提下提升性能。

实验结果

研究问题

  • RQ1最优传输能否作为原理清晰、可微的正则化项,用于改善弱监督下图像与文本之间的跨域对齐?
  • RQ2在性能与可解释性方面,基于OT的对齐方法相较于注意力机制与排序损失有何差异?
  • RQ3在不增加架构复杂度的前提下,OT能在多大程度上提升图像-文本检索与短语定位等视觉-语言任务的性能?
  • RQ4在弱监督设定下,OT正则化是否能促进图像与文本编码器更好地学习特征表示?
  • RQ5OT传输计划是否能提供比标准注意力矩阵更可解释且更稀疏的对齐结果?

主要发现

  • 在Flickr30k数据集上,所提出的OT_T与OT_S模型在短语定位任务中的R@1得分分别为35.98与41.12,显著优于基线SCAN模型(20.79)。
  • 当λ=2且η=0.12时,OT增强模型的总检索得分(Rsum)达到466.3,超过基于余弦相似度的基线模型(450.8)。
  • 消融实验表明,将OT加入余弦相似度可一致提升所有指标性能,R@1提升4.5个百分点,Rsum提升1.6个百分点。
  • 可视化结果表明,OT传输计划T生成的对齐结果比标准注意力矩阵更稀疏且更具可解释性,图像区域与文本短语之间的对应关系更清晰。
  • 该方法使更简单的模型能够匹配甚至超越更复杂架构的性能,证明了OT作为正则化项的有效性。
  • 定性结果表明,即使图像与句子并非精确匹配对,模型仍能检索到语义相关的结果,显示出强大的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。