Skip to main content
QUICK REVIEW

[论文解读] Image Captioning as an Assistive Technology: Lessons Learned from VizWiz 2020 Challenge

Pierre Dognin, Igor Melnyk|arXiv (Cornell University)|Dec 21, 2020
Multimodal Machine Learning Applications被引用 8
一句话总结

本论文提出了一套稳健的多模态图像字幕系统,专为视障用户在现实场景中的辅助使用而设计,利用ResNeXt提取视觉特征,结合旋转不变的OCR文本识别与目标检测,通过多模态Transformer与复制机制实现特征融合。该系统在VizWiz 2020挑战赛中取得了最先进性能,即使在图像模糊、旋转等质量问题下,仍能生成任务导向且语义丰富的字幕。

ABSTRACT

Image captioning has recently demonstrated impressive progress largely owing to the introduction of neural network algorithms trained on curated dataset like MS-COCO. Often work in this field is motivated by the promise of deployment of captioning systems in practical applications. However, the scarcity of data and contexts in many competition datasets renders the utility of systems trained on these datasets limited as an assistive technology in real-world settings, such as helping visually impaired people navigate and accomplish everyday tasks. This gap motivated the introduction of the novel VizWiz dataset, which consists of images taken by the visually impaired and captions that have useful, task-oriented information. In an attempt to help the machine learning computer vision field realize its promise of producing technologies that have positive social impact, the curators of the VizWiz dataset host several competitions, including one for image captioning. This work details the theory and engineering from our winning submission to the 2020 captioning competition. Our work provides a step towards improved assistive image captioning systems.

研究动机与目标

  • 开发一种实用的、面向现实场景的图像字幕系统,支持视障用户完成日常任务。
  • 通过聚焦于任务导向、目标驱动的字幕,克服在MS-COCO等精选数据集上预训练的通用字幕模型的局限性。
  • 提升系统对视障用户拍摄图像中常见的现实世界图像质量问题(如模糊、旋转、遮挡和光照不足)的鲁棒性。
  • 将多模态输入(视觉特征、检测到的文本和物体)整合到统一的字幕生成框架中,以提升语义理解能力。
  • 通过复制机制实现词汇表外词汇的生成,尤其针对OCR检测到的、标准词汇表中不存在的术语。

提出的方法

  • 采用在Instagram图像上预训练的ResNeXt-101-32x8d主干网络,从低质量的真实世界图像中提取稳健的视觉特征。
  • 实现了一种字典引导的旋转不变OCR模块,通过评估四种图像方向下的文本识别结果,选择语义连贯性最高的输出。
  • 集成基于Faster R-CNN的物体检测流程,利用fastText嵌入对场景中的物体进行检测与表征。
  • 通过多模态Transformer编码器-解码器架构,将视觉特征、OCR标记和物体检测结果融合为统一的多模态表征。
  • 在Transformer解码器中引入复制机制,允许从OCR或物体检测中复制词汇表外的标记,从而提升罕见或领域特定术语的生成能力。
  • 采用交叉熵预训练结合自Critical序列训练(SCST)的方式进行模型训练,以CIDEr得分为目标进行优化,提升字幕的质量与相关性。

实验结果

研究问题

  • RQ1如何使图像字幕系统在视障用户拍摄图像时,对模糊、旋转和遮挡等现实世界图像质量问题具备鲁棒性?
  • RQ2在辅助场景中,多模态输入(特别是OCR与物体检测)在多大程度上能提升生成字幕的语义丰富度与任务相关性?
  • RQ3复制机制能否有效处理来自OCR或物体检测的词汇表外术语,特别是如药物名称等罕见或领域特定词汇?
  • RQ4旋转不变OCR的集成在非标准朝向图像上的字幕性能提升方面起到了什么作用?
  • RQ5在多模态Transformer中整合视觉、文本与物体层级特征,对生成目标导向字幕有何影响?

主要发现

  • 该系统在VizWiz 2020图像字幕挑战赛中取得了最先进性能,证明了多模态融合与稳健预处理的有效性。
  • OCR模态在生成准确字幕方面起到了关键作用,尤其在检测并整合罕见或领域特定术语(如‘bemiks’)方面表现突出,这些术语不在标准词汇表中。
  • 旋转不变OCR模块显著提升了在旋转图像上的识别可靠性,在多个测试案例中均观察到性能提升。
  • 物体检测通过帮助模型识别并描述细微或部分遮挡的物体(如在杂乱场景中几乎不可见的汽车)提升了字幕质量。
  • 复制机制成功从OCR中生成了词汇表外术语,如‘heinz’、‘tomato’和‘ketchup’,证明其在现实世界、任务导向字幕生成中的实用性。
  • 基于PWA的实时演示(使用Flask与Watson文本转语音)成功实现了音频字幕的生成与播放,包含检测到的文本与物体信息,实现了跨设备的实际可用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。