Skip to main content
QUICK REVIEW

[论文解读] Transform and Tell: Entity-Aware News Image Captioning

Alasdair Tran, A. P. Mathews|arXiv (Cornell University)|Apr 17, 2020
Multimodal Machine Learning Applications参考文献 43被引用 8
一句话总结

本文提出了一种端到端的、具备实体感知能力的新闻图像字幕生成模型,该模型在文本、图像、人脸和物体上整合了多模态注意力机制,并结合基于子词编码(byte-pair encoding)的Transformer解码器。该模型在GoodNews数据集上的CIDEr得分实现了4.1倍的提升(13.1→53.8),并引入了NYTimes800k数据集,这是迄今为止规模最大的新闻图像字幕数据集,包含793,000张图像及图像位置标注。

ABSTRACT

We propose an end-to-end model which generates captions for images embedded in news articles. News images present two key challenges: they rely on real-world knowledge, especially about named entities; and they typically have linguistically rich captions that include uncommon words. We address the first challenge by associating words in the caption with faces and objects in the image, via a multi-modal, multi-head attention mechanism. We tackle the second challenge with a state-of-the-art transformer language model that uses byte-pair-encoding to generate captions as a sequence of word parts. On the GoodNews dataset, our model outperforms the previous state of the art by a factor of four in CIDEr score (13 to 54). This performance gain comes from a unique combination of language models, word representation, image embeddings, face embeddings, object embeddings, and improvements in neural network design. We also introduce the NYTimes800k dataset which is 70% larger than GoodNews, has higher article quality, and includes the locations of images within articles as an additional contextual cue.

研究动机与目标

  • 解决现有图像字幕模型在处理新闻图像中真实世界知识和语言表达力方面的局限性。
  • 生成包含罕见或未见专有名词(如人名和新兴概念)的语言丰富型字幕。
  • 通过多模态注意力机制整合文章文本、图像内容、人脸和物体的上下文信息,提升字幕质量。
  • 开发一个可扩展的、高质量的新闻图像字幕数据集,支持长期的语言演化与上下文理解。
  • 证明端到端学习结合动态卷积与自适应Softmax可超越基于模板或抽取式的方法。

提出的方法

  • 模型使用RoBERTa编码器处理文章文本,生成上下文相关的词元嵌入。
  • 通过视觉Transformer和目标检测模型提取图像、人脸和物体特征,为每种模态生成独立的嵌入表示。
  • 多头注意力机制使解码器在生成字幕时能够同时关注图像块、文章文本、检测到的人脸和物体。
  • 解码器采用动态卷积来高效关注已生成的词元,替代标准自注意力机制以实现自回归生成。
  • 使用子词编码(BPE)表示词汇表,使模型能够在不依赖固定词汇表的情况下生成罕见或未见的词汇。
  • 在最后一层应用自适应Softmax,通过按频率聚类词汇表来提升训练效率。

实验结果

研究问题

  • RQ1能否通过联合关注文本、图像、人脸和物体的多模态注意力机制,显著提升新闻图像中实体感知字幕生成的效果?
  • RQ2基于BPE的语言模型结合动态卷积,在多大程度上能提升字幕的语言多样性,并有效处理罕见或未见的专有名词?
  • RQ3在文章中引入图像位置作为上下文线索,对字幕生成性能有何影响?
  • RQ4各独立组件(BPE、动态卷积、多模态注意力、自适应Softmax)对整体字幕生成性能的贡献分别是什么?
  • RQ5像NYTimes800k这样大规模、高质量的新闻图像字幕数据集,是否能支持更好的泛化能力与长期语言适应?

主要发现

  • 与之前的最先进方法相比,该模型在GoodNews数据集上的CIDEr得分提升了4.1倍(13.1→53.8)。
  • BLEU-4得分提升6.8倍(0.89→6.05),表明与人类参考字幕的n-gram重叠度显著提高。
  • 该模型生成的字幕平均长度为15个词,远超之前最先进方法(平均10个词),更接近人类字幕的平均长度(18个词)。
  • 模型成功生成了训练过程中未见过的命名实体和罕见专有名词,表明其对未见词汇具有强大的泛化能力。
  • 消融实验表明,多模态注意力、BPE、动态卷积和自适应Softmax各组件均对性能提升有显著贡献。
  • NYTimes800k数据集比GoodNews大70%,且包含图像位置线索,使所有指标上均实现一致的性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。