Skip to main content
QUICK REVIEW

[论文解读] Finding the Evidence: Localization-aware Answer Prediction for Text Visual Question Answering

Wei Han, Hantao Huang|arXiv (Cornell University)|Oct 6, 2020
Multimodal Machine Learning Applications参考文献 20被引用 9
一句话总结

本文提出LaAP-Net,一种用于文本视觉问答的定位感知答案预测网络,能够联合预测答案及其在图像中的支持性边界框。通过整合上下文增强的OCR表征和定位感知解码器,该模型提升了答案准确率并提供了可解释的证据,在TextVQA(41.41%准确率)、ST-VQA(0.485 ANLS)和OCR-VQA(64.1%准确率)上达到最先进性能。

ABSTRACT

Image text carries essential information to understand the scene and perform reasoning. Text-based visual question answering (text VQA) task focuses on visual questions that require reading text in images. Existing text VQA systems generate an answer by selecting from optical character recognition (OCR) texts or a fixed vocabulary. Positional information of text is underused and there is a lack of evidence for the generated answer. As such, this paper proposes a localization-aware answer prediction network (LaAP-Net) to address this challenge. Our LaAP-Net not only generates the answer to the question but also predicts a bounding box as evidence of the generated answer. Moreover, a context-enriched OCR representation (COR) for multimodal fusion is proposed to facilitate the localization task. Our proposed LaAP-Net outperforms existing approaches on three benchmark datasets for the text VQA task by a noticeable margin.

研究动机与目标

  • 通过提供用于预测的定位边界框作为答案证据,解决现有文本VQA模型缺乏答案证据的问题。
  • 通过利用OCR标记和图像特征中的位置与上下文信息,提升文本VQA中的多模态推理能力。
  • 通过生成与空间位置对齐的答案证据,增强模型可解释性,降低对数据集偏差的依赖。
  • 通过统一的定位感知架构,在多个基准文本VQA数据集上实现最先进性能。
  • 通过引入上下文增强的OCR表征,简化多模态融合,将对象级上下文与文本特征相结合。

提出的方法

  • 提出一种定位感知答案预测(LaAP)模块,在解码过程中为生成答案的OCR标记预测一个边界框。
  • 引入上下文增强的OCR表征(COR),利用位置引导注意力机制将对象特征注入OCR嵌入表示中。
  • 采用基于Transformer的编码器-解码器架构,并为答案生成和边界框预测分别设置独立头。
  • 使用多任务学习目标,联合优化答案准确率与定位IoU,从而同时提升性能与可解释性。
  • 在解码器中引入OCR位置嵌入,以增强答案预测的空间定位能力。
  • 应用动态指针网络,从固定词汇表和OCR标记中选择答案,支持词汇外答案的生成。

实验结果

研究问题

  • RQ1联合预测答案及其支持性边界框是否能提升文本VQA中的性能与可解释性?
  • RQ2将上下文图像特征融入OCR表征,对文本VQA中的多模态推理有何影响?
  • RQ3定位感知预测在多大程度上减少了模型对数据集偏差或统计捷径的依赖?
  • RQ4具有共享编码器和多任务解码器的统一架构是否能在开放词汇文本VQA基准上超越现有方法?
  • RQ5该模型在具有不同图像与文本特征的多样化文本VQA数据集上泛化能力如何?

主要发现

  • LaAP-Net在TextVQA测试集上达到41.41%的准确率,比之前的SOTA方法M4C高出1.44个百分点。
  • 在ST-VQA数据集上,LaAP-Net取得0.485的ANLS分数,较之前的SOTA方法SMA提升0.019,较挑战赛冠军方法VTA高出0.20的绝对分数。
  • 在OCR-VQA数据集上,LaAP-Net达到64.1%的准确率,创下新SOTA纪录,尽管该数据集聚焦于书封面且视觉上下文有限。
  • 定性分析显示,预测边界框在80%的成功案例中与真实区域对齐良好,70%的样本IoU分数高于0.5。
  • 失败案例显示,模型对相对空间语言(如“右方”、“中间”)较为敏感,表明在缺乏显式空间线索时,其对相对位置的推理能力有限。
  • 模型展现出更强的鲁棒性与可解释性,因为预测的边界框可作为答案解释的视觉证据,减少了对统计模式的依赖。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。