[论文解读] Retrieval-augmented Image Captioning
本文提出 extra,一种检索增强的图像字幕生成模型,通过使用预训练的视觉-语言 BERT(LXMERT)联合编码输入图像和 k 个检索到的字幕,从而提升字幕生成质量。通过利用视觉区域和语义相关的文本上下文之间的跨模态表示,该模型在不微调的情况下即可在 COCO 数据集上实现最先进性能,表明检索增强生成通过更丰富的多模态上下文提升了字幕质量。
Inspired by retrieval-augmented language generation and pretrained Vision and Language (V&L) encoders, we present a new approach to image captioning that generates sentences given the input image and a set of captions retrieved from a datastore, as opposed to the image alone. The encoder in our model jointly processes the image and retrieved captions using a pretrained V&L BERT, while the decoder attends to the multimodal encoder representations, benefiting from the extra textual evidence from the retrieved captions. Experimental results on the COCO dataset show that image captioning can be effectively formulated from this new perspective. Our model, named EXTRA, benefits from using captions retrieved from the training dataset, and it can also benefit from using an external dataset without the need for retraining. Ablation studies show that retrieving a sufficient number of captions (e.g., k=5) can improve captioning quality. Our work contributes towards using pretrained V&L encoders for generative tasks, instead of standard classification tasks.
研究动机与目标
- 为解决标准图像字幕模型仅依赖视觉特征的局限性,通过引入外部文本上下文来改进模型。
- 探究预训练的视觉-语言 BERT 是否可被有效重用于分类以外的生成任务。
- 评估从数据存储中检索多个字幕对字幕生成性能的影响。
- 实现在不微调主模型的前提下,零样本适应外部数据集。
- 通过在推理过程中展示检索到的字幕,提升可解释性并减少对视觉注意力图的依赖。
提出的方法
- 该模型使用预训练的 LXMERT 编码器联合处理输入图像(表示为 36 个物体区域)和 k 个检索到的字幕。
- 检索到的字幕被分词并用特殊的 CLS 和 SEP 标记连接,形成单个输入序列供视觉-语言编码器处理。
- 检索系统使用 FAISS 根据图像嵌入相似度查找最接近的 k 个字幕,数据存储中包含图像-字幕对。
- Transformer 解码器关注跨模态编码器的输出,以生成最终字幕。
- 该模型在 COCO 上使用标准语言建模范式进行微调,当使用外部数据时无需重新训练。
- 该方法通过从外部数据集动态检索相关字幕,实现域内和域外泛化。
实验结果
研究问题
- RQ1使用预训练的视觉-语言 BERT 联合编码图像和检索到的字幕,能否提升图像字幕生成性能?
- RQ2检索的字幕数量(k)如何影响字幕质量和模型鲁棒性?
- RQ3模型是否能从外部数据集检索字幕中获益而无需重新训练?
- RQ4使用检索到的字幕是否能提升可解释性并减少对视觉注意力图的依赖?
- RQ5数据存储中的偏差如何影响生成的字幕?检索能否缓解或揭示此类偏差?
主要发现
- 该模型在 COCO 数据集上表现优异,当使用检索到的字幕后,优于仅使用视觉特征的标准图像字幕基线模型。
- 消融实验表明,检索 k=5 个字幕时性能最佳,表明多个检索示例可提供更丰富的上下文。
- 该模型能有效利用外部数据集(如 COCO)的字幕,在不重新训练的情况下提升 Flickr30K 上的性能,证明了零样本泛化能力。
- 当检索到的字幕语义相关时,模型性能提升,表明检索质量直接影响字幕质量。
- 检索到的字幕不匹配或存在偏差时,可能导致错误或有偏见的输出,强调了分析检索示例对可解释性的重要性。
- 通过展示检索到的字幕,该模型提供了可解释性,为黑箱注意力图提供了透明的替代方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。