[论文解读] SuperCaptioning: Image Captioning Using Two-dimensional Word Embedding
本文提出了一种名为 SuperCaptioning 的新型图像字幕生成方法,该方法使用二维词嵌入在单一卷积神经网络(CNN)模型中联合处理视觉与文本特征。通过将文本转换为类似图像的表示形式,并将其与输入图像结合,该方法在 Flickr30k 数据集上实现了高质量的字幕生成,相较于传统的双流方法,通过统一架构的端到端训练实现了性能提升。
Language and vision are processed as two different modal in current work for image captioning. However, recent work on Super Characters method shows the effectiveness of two-dimensional word embedding, which converts text classification problem into image classification problem. In this paper, we propose the SuperCaptioning method, which borrows the idea of two-dimensional word embedding from Super Characters method, and processes the information of language and vision together in one single CNN model. The experimental results on Flickr30k data shows the proposed method gives high quality image captions. An interactive demo is ready to show at the workshop.
研究动机与目标
- 解决当前图像字幕模型分别处理视觉与语言信息的局限性。
- 探索二维词嵌入(最初用于文本分类)在图像字幕生成中的有效性。
- 将图像与文本处理统一到单一 CNN 模型中,实现端到端的字幕生成。
- 通过利用低功耗 CNN 加速器,实现在设备端的高效推理。
提出的方法
- 该方法使用平方英文词(SEW)技术,将原始文本转换为二维图像表示,其中每个字符占据固定的网格空间。
- 将输入图像与文本嵌入合并为一张 224×224 的 SuperCaptioning 图像,图像位于上方,文本位于下方。
- 使用在 ImageNet 上预训练并微调过的 SE-Net-154 模型作为主干网络,其最后一层重新配置为 11,571 个类别,对应词汇表大小。
- 模型通过迭代方式预测字幕序列中的下一个词,当生成 EOS(句末)标记或达到最大词数(14)时停止预测。
- 训练数据通过为每张 SuperCaptioning 图像标注真实字幕中的下一个词生成,将字幕生成任务视为多分类任务。
- 该方法借鉴了 Super Characters 框架在文本分类中的成功经验,将其适配用于图像与语言的联合建模,以实现图像字幕生成。
实验结果
研究问题
- RQ1二维词嵌入是否能通过在单一 CNN 中联合处理视觉与语言信息,从而提升图像字幕生成性能?
- RQ2与传统的双流模型相比,SuperCaptioning 方法在字幕质量与连贯性方面表现如何?
- RQ3哪些超参数(例如字体大小、截断长度、图像缩放)能在 Flickr30k 数据集上实现最优的字幕生成效果?
- RQ4该方法能否生成包含对象数量、颜色、背景上下文及动作细节等信息的描述性字幕?
- RQ5该方法是否适合在配备专用 CNN 加速器的低功耗边缘设备上部署?
主要发现
- SuperCaptioning 方法生成的字幕质量高,能准确描述对象数量,例如在描述‘四名身穿救生衣的人在船上’的示例中表现优异。
- 该模型有效捕捉了颜色信息,例如‘一名穿黑色大衣的女性手持红色雨伞’,体现出精细的视觉-语言对齐能力。
- 该方法生成的字幕上下文丰富,包含山脉等背景元素,表明具备较强的场景理解能力。
- 该模型能生成详细的动作描述,例如‘芭蕾舞者双臂伸展’,展现出对动态场景的捕捉能力。
- 该方法在 Flickr30k 数据集上表现优异,经过筛选后保留了 31,333 张字幕长度少于 14 个词的图像。
- 由于依赖高效的 CNN 推理,该方法适合在设备端部署,尤其适用于新兴的低功耗加速器。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。