Skip to main content
QUICK REVIEW

[论文解读] A Semi-supervised Framework for Image Captioning

Wenhu Chen, Aurélien Lucchi|arXiv (Cornell University)|Nov 16, 2016
Multimodal Machine Learning Applications参考文献 32被引用 14
一句话总结

本文提出了一种用于图像字幕生成的半监督框架,利用大规模域外文本数据对模型进行预训练,并通过人工生成视觉特征来模拟缺失的图像数据。通过使用区域图像特征而非词嵌入,并结合带有注意力机制的评审-解码器架构,该方法在 MS-COCO 和 Flickr30K 数据集上实现了最先进性能,显著提升了字幕生成的准确率与多样性,得益于无监督预训练。

ABSTRACT

State-of-the-art approaches for image captioning require supervised training data consisting of captions with paired image data. These methods are typically unable to use unsupervised data such as textual data with no corresponding images, which is a much more abundant commodity. We here propose a novel way of using such textual data by artificially generating missing visual information. We evaluate this learning approach on a newly designed model that detects visual concepts present in an image and feed them to a reviewer-decoder architecture with an attention mechanism. Unlike previous approaches that encode visual concepts using word embeddings, we instead suggest using regional image features which capture more intrinsic information. The main benefit of this architecture is that it synthesizes meaningful thought vectors that capture salient image properties and then applies a soft attentive decoder to decode the thought vectors and generate image captions. We evaluate our model on both Microsoft COCO and Flickr30K datasets and demonstrate that this model combined with our semi-supervised learning method can largely improve performance and help the model to generate more accurate and diverse captions.

研究动机与目标

  • 解决图像字幕生成中配对图像-字幕训练数据稀缺的问题。
  • 利用大量无监督文本数据(无对应图像)来提升模型泛化能力与性能。
  • 通过在字幕生成流程中用区域图像特征替代词嵌入,提升字幕的多样性与准确性。
  • 开发一种预训练策略,从文本中合成视觉信息以启动学习过程。
  • 证明利用外部文本数据进行半监督学习可在标准基准上带来显著性能提升。

提出的方法

  • 该模型使用卷积神经网络(CNN)提取图像特征,并通过响应图定位器识别与检测到的视觉概念相对应的区域。
  • 将视觉概念映射为区域图像特征(例如来自 ResNet-152 的特征),而非词嵌入,以保留空间与语义显著性。
  • 带有注意力机制的 LSTM 评审模块在多个时间步上聚合区域特征,生成表示显著图像属性的思维向量。
  • 将思维向量输入基于注意力机制的 LSTM 解码器,生成自然语言字幕。
  • 提出一种新颖的预训练阶段,利用域外文本数据通过类似自编码器的噪声增强机制生成合成图像特征,以模拟视觉输入。
  • 在无监督预训练后,使用域内图像-字幕对对模型进行微调,结合监督与无监督信号。

实验结果

研究问题

  • RQ1当配对图像数据有限时,能否有效利用大规模无监督文本数据来提升图像字幕生成性能?
  • RQ2用区域图像特征替代词嵌入是否能带来更准确且更多样化的字幕生成?
  • RQ3带有迭代思维向量优化的评审-解码器架构是否能相比标准注意力机制提升字幕质量?
  • RQ4在域外文本数据上进行预训练在多大程度上可减少对昂贵配对训练数据的依赖?
  • RQ5在预训练过程中引入噪声在多大程度上影响模型在图像字幕生成任务中的鲁棒性与泛化能力?

主要发现

  • 该模型在 MS-COCO 和 Flickr30K 上均优于现有最先进方法,在官方 COCO 测试服务器排行榜上达到最先进水平。
  • 在域外文本数据上进行预训练显著提升了 BLEU-4 分数,其中在 Flickr30K 上提升最大,因其训练集更小。
  • 使用区域图像特征替代词嵌入在所有指标上均带来更高的 CIDEr、BLEU 和 METEOR 分数。
  • 在预训练阶段引入噪声可提升模型鲁棒性,相比干净预训练,其在 CIDEr 和 METEOR 上表现更优。
  • 融合区域特征与评审模块的模型集成实现了最高性能,COCO 测试集上的 CIDEr 分数超过 120。
  • 无监督预训练阶段使模型能够生成更具多样性的字幕,这一点通过定性分析和提升的人工一致性评分得到验证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。