Skip to main content
QUICK REVIEW

[论文解读] Clue: Cross-modal Coherence Modeling for Caption Generation

Malihe Alikhani, Piyush Sharma|arXiv (Cornell University)|May 2, 2020
Multimodal Machine Learning Applications参考文献 39被引用 6
一句话总结

本文提出了 Clue,一种用于图像字幕生成的跨模态连贯性建模框架,通过使用受话语理论启发的连贯性关系(如 Visible、Story、Subjective 等)来提升字幕的质量与一致性。通过在 10,000 个图像-字幕对上标注这些关系,并训练具备连贯性感知能力的字幕生成模型,作者在人类评分的质量与偏好方面显著优于无连贯性感知的模型。

ABSTRACT

We use coherence relations inspired by computational models of discourse to study the information needs and goals of image captioning. Using an annotation protocol specifically devised for capturing image--caption coherence relations, we annotate 10,000 instances from publicly-available image--caption pairs. We introduce a new task for learning inferences in imagery and text, coherence relation prediction, and show that these coherence annotations can be exploited to learn relation classifiers as an intermediary step, and also train coherence-aware, controllable image captioning models. The results show a dramatic improvement in the consistency and quality of the generated captions with respect to information needs specified via coherence relations.

研究动机与目标

  • 通过建模跨模态连贯性关系,解决大规模图像字幕生成中的内容与上下文幻觉问题。
  • 开发一种系统化的标注协议,以捕捉多模态交流中的图像-文本连贯性关系。
  • 训练具备连贯性感知能力的字幕生成模型,使其输出与特定信息需求保持一致。
  • 发布 Clue 数据集,以支持未来在跨模态连贯性与可控生成方面的研究。
  • 证明具备连贯性感知能力的字幕生成模型在人类评分的质量与偏好方面优于标准模型。

提出的方法

  • 使用自定义协议对来自 Conceptual Captions 和 Open Images 的 10,000 个图像-字幕对进行标注,涵盖六种连贯性关系:Visible、Meta、Subjective、Story、Identification 和 Other。
  • 定义并形式化受话语理论启发的跨模态连贯性关系,例如 Visible(对视觉内容的锚定)和 Story(超越图像内容的叙事发展)。
  • 利用视觉与文本编码器提取的多模态特征,训练分类器以预测图像与字幕之间的连贯性关系。
  • 通过基于条件控制机制微调字幕生成模型,使其可根据指定的连贯性关系(如生成 'Story' 类型的字幕)控制输出。
  • 使用人类评估与自动指标对比具备连贯性感知与无连贯性感知模型在质量、相关性与偏好方面的表现。
  • 发布 Clue 数据集与代码,以支持可复现性及未来在跨模态连贯性建模方面的研究。

实验结果

研究问题

  • RQ1能否系统性地将基于话语的连贯性关系应用于图像-文本对,以建模信息层面的推理?
  • RQ2不同连贯性关系(如 Visible、Story、Subjective)如何影响生成字幕的内容与结构?
  • RQ3能否训练出一个模型,以高精度预测图像与字幕之间的连贯性关系?
  • RQ4通过在特定连贯性关系上条件化字幕生成,是否能提升人类评分的字幕质量与一致性?
  • RQ5在人类偏好与质量评估中,具备连贯性感知能力的模型在多大程度上优于标准模型?

主要发现

  • 具备连贯性感知能力的字幕生成模型在人类对比中获得了 68.2% 的偏好率,显著优于无连贯性感知模型的 31.8% 偏好率。
  • 人类评估者对具备连贯性感知模型生成字幕的质量评分为 3.44/5,而无连贯性感知模型为 2.83/5,差异具有统计学显著性(p < 0.05)。
  • 字幕的相关性评分相近(4.43 vs. 4.40),表明具备连贯性感知的模型在提升质量的同时保持了相关性。
  • 尽管在人类评估中表现更优,CIDEr 得分未见提升(0.958 vs. 0.964),因为参考字幕与训练数据中的连贯性分布一致。
  • Clue 数据集揭示了另一种连贯性关系——Identification(如命名人物或品牌),该关系在以往数据集中因超类化处理而未被捕捉。
  • 本研究证明,连贯性建模可实现更一致、更符合上下文、更受人类青睐的字幕生成,尤其在复杂或叙事性描述中表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。