Skip to main content
QUICK REVIEW

[论文解读] Technical Report: Image Captioning with Semantically Similar Images

Martin Kolář, Michal Hradiš|arXiv (Cornell University)|Jun 12, 2015
Multimodal Machine Learning Applications参考文献 5被引用 5
一句话总结

该论文提出了一种简单而有效的图像字幕生成方法,利用CNN嵌入检索语义相似的训练图像,并基于n元语法频率从其集体字幕中选择最具代表性的字幕。尽管在标准自动评估指标上得分较低,其在图灵测试中的通过率却优于人类字幕,在人类评估中也表现出色,被认为优于或等同于人类字幕。

ABSTRACT

This report presents our submission to the MS COCO Captioning Challenge 2015. The method uses Convolutional Neural Network activations as an embedding to find semantically similar images. From these images, the most typical caption is selected based on unigram frequencies. Although the method received low scores with automated evaluation metrics and in human assessed average correctness, it is competitive in the ratio of captions which pass the Turing test and which are assessed as better or equal to human captions.

研究动机与目标

  • 开发一种简单、非生成式的图像字幕方法,利用语义相似性进行字幕检索。
  • 通过聚合并从语义相似训练图像的多个字幕中选择,提升字幕质量。
  • 不仅在标准指标上,还在人类判断和图灵测试标准下评估该方法的性能。
  • 通过最小的架构复杂度和无需端到端训练,建立图像字幕的强大基线。

提出的方法

  • 使用预训练Caffe CNN(ImageNet-ILSVRC)的最后一个全连接层作为图像的4096维语义嵌入。
  • 在CNN嵌入空间中使用余弦距离,找到与测试图像最接近的10张训练图像。
  • 将所有50个字幕(每张图像5个,共10张最近邻图像)整合为候选语料库,忽略图像排序。
  • 应用基于频率的筛选过程:迭代移除不包含语料库中最频繁词汇的句子,跳过Google N-grams中前100个最常见词汇。
  • 持续进行筛选过程,直到仅剩一个句子,该句子被选为最终字幕。
  • 采用固定的n=10进行最近邻搜索,余弦距离优于其他距离度量。

实验结果

研究问题

  • RQ1基于语义相似性和n元语法频率的简单非生成式方法,是否能在人类评估中超越更复杂的模型?
  • RQ2基于n元语法频率的字幕质量,与人工标注字幕相比,在自然性和连贯性方面如何?
  • RQ3基于检索的字幕系统在多大程度上能通过图灵测试,与人工生成的字幕相比?
  • RQ4尽管自动指标得分较低,该方法在人类判断中是否仍能实现‘优于或等于’人类字幕的表现?

主要发现

  • 该方法有19.4%的字幕被评价为优于或等于人类字幕,显著高于随机基线(0.7%),并接近人类表现(63.8%)。
  • 21.3%的生成字幕通过了图灵测试,而人类字幕为67.5%,随机基线仅为2.0%。
  • 平均正确性得分为3.079(满分5分),远高于随机基线(1.084),但低于人类(4.836)。
  • 平均细节水平得分为3.482(满分5分),略高于人类(3.428),显著高于随机基线(3.247),表明描述质量尚可。
  • 15.4%的生成字幕被认为与人类描述相似,而人类字幕为35.2%,随机基线为1.3%。
  • 尽管在标准自动指标上得分较低,该方法在以人类为中心的评估中表现强劲,尤其在主观质量与人类相似度方面。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。