[论文解读] Retrieval-Augmented Transformer for Image Captioning
本文提出了一种用于图像字幕生成的检索增强型Transformer模型,通过在视觉特征上使用k-NN搜索从外部记忆中检索相关文本描述,从而提升生成质量。通过集成k-NN增强的注意力层,该模型提高了字幕的多样性与准确性,在COCO数据集上实现了SOTA性能,相较于微调后的基线Transformer模型,CIDEr得分提升了1.2分。
Image captioning models aim at connecting Vision and Language by providing natural language descriptions of input images. In the past few years, the task has been tackled by learning parametric models and proposing visual feature extraction advancements or by modeling better multi-modal connections. In this paper, we investigate the development of an image captioning approach with a kNN memory, with which knowledge can be retrieved from an external corpus to aid the generation process. Our architecture combines a knowledge retriever based on visual similarities, a differentiable encoder, and a kNN-augmented attention layer to predict tokens based on the past context and on text retrieved from the external memory. Experimental results, conducted on the COCO dataset, demonstrate that employing an explicit external memory can aid the generation process and increase caption quality. Our work opens up new avenues for improving image captioning models at larger scale.
研究动机与目标
- 为解决减少模型记忆依赖、生成高质量且多样化的图像字幕的挑战。
- 探索在视觉-语言生成任务中通过检索机制整合外部知识的可行性。
- 在不显著增加模型规模或训练成本的前提下提升字幕生成性能。
- 评估从外部记忆中检索信息是否能提升视觉-语言生成任务中的生成质量。
- 证明k-NN增强注意力机制在图像字幕生成中的可行性和有效性。
提出的方法
- 该模型使用视觉编码器提取图像特征,并采用带有k-NN增强注意力层的可微分Transformer解码器。
- 知识检索模块在视觉嵌入空间中执行近似k-NN搜索,从外部记忆中检索与图像相关的文本字幕。
- k-NN增强的注意力层同时关注已生成的标记和检索到的文本,实现上下文感知的生成。
- 外部记忆由大规模图像-字幕对语料构建,利用视觉特征进行索引和语义相关字幕的检索。
- 模型采用交叉熵损失端到端训练,并进一步通过CIDEr优化进行微调以提升生成质量。
- 解码过程在CPU上执行k-NN搜索,导致推理时间相比标准Transformer增加了26%。
实验结果
研究问题
- RQ1在不增加模型规模的前提下,外部记忆检索能否提升图像字幕生成性能?
- RQ2基于视觉相似性的k-NN检索在检索与图像生成相关的文本描述方面有多高效?
- RQ3通过k-NN增强注意力层整合检索文本是否能生成质量更高、更富多样的字幕?
- RQ4该检索增强模型与当前SOTA的基于Transformer的字幕模型及RETRO架构相比表现如何?
- RQ5当检索到的字幕部分不准确或与输入图像不匹配时,模型是否仍能保持性能?
主要发现
- 在使用强化学习微调后,该检索增强模型相较于标准Transformer基线模型在CIDEr指标上提升了1.2分。
- 在COCO数据集的Karpathy测试集上,该模型在所有标准评估指标(BLEU、ROUGE、CIDEr、METEOR)上均优于其他SOTA模型。
- k-NN增强的注意力层显著提升了字幕质量,尤其在生成更具描述性和多样性的短语方面表现突出。
- 定性分析表明,检索到的字幕通常与视觉内容匹配,并引导模型生成更准确的描述,例如“一群老年人”或“一个男人在跳跃”。
- 即使部分检索到的字幕不相关,模型仍表现出鲁棒性,能依靠视觉特征纠正错误。
- 引入检索机制使训练时间增加了约6小时(从24小时增至30小时),推理时间因k-NN搜索开销增加了26%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。