Skip to main content
QUICK REVIEW

[论文解读] Expressing Visual Relationships via Language

Hao Tan, Franck Dernoncourt|arXiv (Cornell University)|Jun 18, 2019
Multimodal Machine Learning Applications参考文献 44被引用 4
一句话总结

本文提出了一种新型的图文引导图像编辑数据集,并设计了一种具有静态和动态关系注意力机制的关系说话者模型,用于生成两幅图像之间视觉关系的自然语言描述。该模型在三个数据集上均优于所有基线模型,在两图描述任务中实现了最先进性能,通过更优的视觉变换与关系建模实现了突破。

ABSTRACT

Describing images with text is a fundamental problem in vision-language research. Current studies in this domain mostly focus on single image captioning. However, in various real applications (e.g., image editing, difference interpretation, and retrieval), generating relational captions for two images, can also be very useful. This important problem has not been explored mostly due to lack of datasets and effective models. To push forward the research in this direction, we first introduce a new language-guided image editing dataset that contains a large number of real image pairs with corresponding editing instructions. We then propose a new relational speaker model based on an encoder-decoder architecture with static relational attention and sequential multi-head attention. We also extend the model with dynamic relational attention, which calculates visual alignment while decoding. Our models are evaluated on our newly collected and two public datasets consisting of image pairs annotated with relationship sentences. Experimental results, based on both automatic and human evaluation, demonstrate that our model outperforms all baselines and existing methods on all the datasets.

研究动机与目标

  • 为解决生成自然语言描述以捕捉两幅真实图像之间复杂视觉关系这一尚未充分探索的任务。
  • 构建一个高质量、多样化的实际图像对数据集,包含人工标注的编辑指令,用于图文引导图像编辑研究。
  • 设计一种神经关系说话者模型,能够有效捕捉超越简单差异的复杂视觉关系。
  • 在多个数据集(包括新收集的数据集和两个公开基准)上评估模型,以证明其泛化能力与鲁棒性。
  • 公开提供数据集与代码库,以推动关系视觉描述研究的发展。

提出的方法

  • 提出一种新型编码器-解码器架构,通过引入静态关系注意力机制,利用预计算的视觉特征建模两幅图像之间的关系。
  • 引入序列多头注意力机制,以捕捉生成描述过程中的长距离依赖与序列推理。
  • 开发一种动态关系注意力模块,在解码过程中联合计算视觉对齐与关系建模,数学上等价于对所有视觉关系进行注意力计算。
  • 采用强化学习与自critical序列训练进行模型训练,以优化BLEU、ROUGE和CIDEr等自动评估指标。
  • 通过在多样化的数据集(包括NLVR2和Spot-the-Diff)上微调,将预训练于新图像编辑数据集的模型适配至零样本迁移任务。
  • 使用预训练模型的物体检测特征作为视觉输入,尽管承认在某些数据集中对小尺寸或细微物体的检测存在局限。

实验结果

研究问题

  • RQ1深度学习模型能否有效生成自然语言描述,以捕捉两幅真实世界图像之间的复杂视觉关系?
  • RQ2与静态注意力或基线模型相比,引入动态关系注意力在建模视觉变换与关系方面有何改进?
  • RQ3在大规模图像编辑指令数据集上预训练的模型,能在多大程度上泛化至其他两图描述基准(如Spot-the-Diff和NLVR2)?
  • RQ4该模型最有效地捕捉哪些类型的视觉关系(例如,物体层面的变化、空间位移、颜色调整)?
  • RQ5在自动评估与人工评估设置下,该模型相较于现有方法表现如何?

主要发现

  • 所提出的带有动态关系注意力的关系说话者模型在三个评估数据集上均达到最先进性能:新收集的图像编辑请求数据集、Spot-the-Diff与NLVR2。
  • 在图像编辑请求数据集上,该模型在自动指标(如CIDEr、BLEU)与人工评估中均显著优于所有基线模型,表现出与人工标注指令的优越对齐性。
  • 在Spot-the-Diff数据集上,该模型在所有方法中取得最高CIDEr得分,人工评估也证实其在描述差异方面具有更高的准确性,尽管仍存在因实体识别错误或遗漏细微变化而导致的错误。
  • 在NLVR2数据集上,尽管视觉推理任务复杂,该模型仍表现出强劲性能,表明其具备泛化至多样化视觉关系类型的能力。
  • 该模型性能对图像内容敏感,尤其在检测小尺寸或低可见度物体时表现受限,提示在物体检测器失效时视觉特征提取存在局限。
  • 动态关系注意力机制使模型即使在无显式定位的情况下,也能隐式学习像素级差异,证明其在建模视觉变换方面的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。