[论文解读] Informative Image Captioning with External Sources of Information
本文提出了一种多模态、多编码器的Transformer模型,通过整合来自上游模型的细粒度实体标签与图像特征,生成流畅且信息丰富的字幕。通过引入覆盖率控制机制,该模型在推理时能够提升实体提及频率,实现人类评分信息量提升24.33%,同时不损害流畅性。
An image caption should fluently present the essential information in a given image, including informative, fine-grained entity mentions and the manner in which these entities interact. However, current captioning models are usually trained to generate captions that only contain common object names, thus falling short on an important "informativeness" dimension. We present a mechanism for integrating image information together with fine-grained labels (assumed to be generated by some upstream models) into a caption that describes the image in a fluent and informative manner. We introduce a multimodal, multi-encoder model based on Transformer that ingests both image features and multiple sources of entity labels. We demonstrate that we can learn to control the appearance of these entity labels in the output, resulting in captions that are both fluent and informative.
研究动机与目标
- 解决现有图像字幕模型在生成细粒度实体提及(如特定人物、电影或事件)方面的局限性。
- 通过整合来自上游模型的预计算细粒度实体标签,而非仅依赖图像像素,提升字幕的信息量。
- 开发一种训练机制,实现在推理时对生成字幕中实体提及的覆盖范围进行控制。
- 证明结合图像特征与外部实体源可生成更准确、更信息丰富的字幕,并通过人类评估加以验证。
- 表明即使使用大规模网络数据,未访问细粒度标签的模型在正确性与信息量方面仍表现欠佳。
提出的方法
- 该模型采用多编码器架构,为图像特征和多个实体标签源(如目标检测器、网络实体识别模型)分别设置独立编码器。
- 多门控解码器同时关注图像表征与实体嵌入,实现细粒度标签在字幕生成过程中的可控融合。
- 该模型采用覆盖率控制机制,学习在解码过程中提高特定实体提及的生成概率,基于可学习的覆盖率因子。
- 在性能最佳的配置中,覆盖率因子设为1.5,显著提升了输出中对象标签与网络实体的出现频率。
- 训练目标通过标准字幕评估指标(如CIDEr)和双倍对比评估设置下的人工评估,优化流畅性与信息量。
- 使用上游模型(如“Eric Clapton”或“Season of the Witch”)预计算的实体标签作为输入,避免端到端联合训练实体识别。
实验结果
研究问题
- RQ1将来自外部源的预计算细粒度实体标签整合进来,能否显著提升图像字幕的信息量?
- RQ2覆盖率控制机制是否能实现对生成字幕中实体提及频率的可控、可学习的增强,同时不损害流畅性?
- RQ3在正确性与信息量方面,未访问细粒度标签的字幕模型与使用这些标签的模型相比表现如何?
- RQ4在评估字幕质量时,人类判断与自动覆盖率得分的相关性有多大?
- RQ5多编码器、多门控Transformer架构能否有效整合多种来源的实体信息,同时保持输出的流畅性?
主要发现
- 与Sharma等人(2018)的基线模型相比,该模型在人类评分的信息量上提升了24.33%,该基线模型未使用外部实体标签。
- 模型在正确性方面提升了7.79%,表明整合细粒度实体可增强事实准确性。
- 流畅性得以保持,人类流畅性评分仅下降0.87%,表明语言质量未下降。
- 采用1.5覆盖率因子的覆盖率控制机制显著增加了生成字幕中对象标签与网络实体的出现频率。
- 人工评估确认,未访问细粒度标签的模型生成的字幕信息量低7.91%,正确性低7.33%,验证了外部实体源的必要性。
- 结果表明,在训练中使用实体类型(如“person”)而非表面形式(如“Eric Clapton”)可提升泛化能力并获得更高性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。