Skip to main content
QUICK REVIEW

[论文解读] Comprehensive Image Captioning via Scene Graph Decomposition

Yiwu Zhong, Liwei Wang|arXiv (Cornell University)|Jul 23, 2020
Multimodal Machine Learning Applications参考文献 65被引用 14
一句话总结

本文提出Sub-GC,一种新颖的图像字幕模型,通过将图像的场景图分解为多个子图,每个子图代表一个语义组件。通过使用图神经网络和基于注意力的生成机制,对各个子图进行选择与解码,该模型在字幕多样性、定位准确性和可控性方面达到最先进性能,同时保持了出色的字幕质量。

ABSTRACT

We address the challenging problem of image captioning by revisiting the representation of image scene graph. At the core of our method lies the decomposition of a scene graph into a set of sub-graphs, with each sub-graph capturing a semantic component of the input image. We design a deep model to select important sub-graphs, and to decode each selected sub-graph into a single target sentence. By using sub-graphs, our model is able to attend to different components of the image. Our method thus accounts for accurate, diverse, grounded and controllable captioning at the same time. We present extensive experiments to demonstrate the benefits of our comprehensive captioning model. Our method establishes new state-of-the-art results in caption diversity, grounding, and controllability, and compares favourably to latest methods in caption quality. Our project website can be found at http://pages.cs.wisc.edu/~yiwuzhong/Sub-GC.html.

研究动机与目标

  • 解决现有图像字幕模型生成通用、无定位性或不可控字幕的局限性。
  • 通过引入统一框架,克服字幕质量、多样性、定位准确性和可控性之间的权衡。
  • 通过基于子图的注意力机制,实现生成句子标记与图像区域之间的精确关联。
  • 设计一种支持单一架构下多样字幕生成(通过多个子图)和可控字幕生成(通过子图选择)的模型。
  • 通过在解码过程中将注意力限制在相关子图节点上,提升定位性能,增强文本与视觉区域之间的对齐。

提出的方法

  • 从输入图像中提取完整的场景图,其中节点表示对象(包含视觉和文本特征),边表示关系。
  • 从完整场景图中生成一组重叠的子图,每个子图捕捉图像的一个独特语义组件。
  • 训练图神经网络(GNN)以基于其与人类标注字幕的对齐程度,对子图进行排序和选择。
  • 使用仅关注子图内节点的注意力机制,将每个选定子图解码为自然语言句子。
  • 使用序列到序列解码器,并在子图节点上应用交叉注意力机制以生成标记,实现标记到区域的定位。
  • 通过允许用户指定要解码的子图,支持可控字幕生成,从而实现对图像特定组件的针对性描述。

实验结果

研究问题

  • RQ1与完整图建模相比,将场景图分解为子图是否能生成更多样化且语义上更不同的字幕?
  • RQ2基于子图的注意力机制是否能通过将标记与特定图像区域关联,提升生成字幕的定位准确性?
  • RQ3子图选择机制是否能通过允许用户指定要描述的图像组件,实现可控字幕生成?
  • RQ4在字幕质量、多样性与定位准确性方面,基于子图的解码是否优于完整图解码?
  • RQ5仅在图像-句子对上进行弱监督训练的模型,是否能在无需显式区域-句子监督的情况下,实现强大的定位与可控性表现?

主要发现

  • Sub-GC在字幕多样性方面达到最先进性能,显著优于以往专为多样性设计的方法。
  • 在Flickr30K Entities数据集上,Sub-GC的F1_all得分为47.1,F1_loc得分为43.1,相较于以往弱监督方法分别相对提升20%和22%。
  • Sub-GC保持了出色的字幕质量,B4得分为12.5,CIDEr得分为112.3,优于最先进多样字幕生成模型,并与最佳质量优化模型表现相当。
  • 该模型展现出强大的定位能力,F1_loc相比完整图基线(Full-GC)提升3.5分,表明生成标记与图像区域之间的对齐性更优。
  • 在可控字幕生成方面,Sub-GC的监督变体在B4上优于NBT和SCT 1.3分,CIDEr上优于6.4分,IoU上优于1.4分,显示出对输出内容更优的控制能力。
  • 即使在弱监督设置下,Sub-GC模型的可控性表现也与监督基线相当,表明子图分解在不依赖完整监督的情况下,增强了模型的归纳偏置。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。