[论文解读] Structured Multimodal Attentions for TextVQA
本文提出结构化多模态注意力(SMA),一种端到端模型,通过异质图注意力网络联合推理视觉对象、OCR标记及其相互关系,从而提升基于文本的视觉问答性能。SMA通过集成问题条件化的图注意力机制与迭代式答案生成,在TextVQA和ST-VQA上取得当前最优性能,超越先前方法,并在TextVQA Challenge 2020中获得第一名。
In this paper, we propose an end-to-end structured multimodal attention (SMA) neural network to mainly solve the first two issues above. SMA first uses a structural graph representation to encode the object-object, object-text and text-text relationships appearing in the image, and then designs a multimodal graph attention network to reason over it. Finally, the outputs from the above modules are processed by a global-local attentional answering module to produce an answer splicing together tokens from both OCR and general vocabulary iteratively by following M4C. Our proposed model outperforms the SoTA models on TextVQA dataset and two tasks of ST-VQA dataset among all models except pre-training based TAP. Demonstrating strong reasoning ability, it also won first place in TextVQA Challenge 2020. We extensively test different OCR methods on several reasoning models and investigate the impact of gradually increased OCR performance on TextVQA benchmark. With better OCR results, different models share dramatic improvement over the VQA accuracy, but our model benefits most blessed by strong textual-visual reasoning ability. To grant our method an upper bound and make a fair testing base available for further works, we also provide human-annotated ground-truth OCR annotations for the TextVQA dataset, which were not given in the original release. The code and ground-truth OCR annotations for the TextVQA dataset are available at https://github.com/ChenyuGAO-CS/SMA
研究动机与目标
- 解决当前SOTA VQA模型在阅读和推理图像中文本(尤其是基于OCR的推理)方面的局限性。
- 通过结构化图建模对象、文本及其相互作用之间的复杂关系,提升多模态推理能力。
- 通过采用受M4C启发的迭代式生成答案机制,克服判别式答案头的限制。
- 通过提供人工标注的OCR真实标签,为TextVQA建立公平基准,以隔离推理性能与OCR错误的影响。
- 探究OCR质量对整体VQA准确率的影响,并证明更优的推理模型能从OCR质量提升中获得更大收益。
提出的方法
- 提出问题自注意力模块,将问题分解为六种关系类型:对象、对象-对象、对象-文本、文本、文本-文本、文本-对象关系。
- 构建异质图,以视觉对象和OCR标记作为节点,基于相对距离与问题成分定义关系(如空间、语义)作为边。
- 采用问题条件化的图注意力网络(GCN),利用问题衍生的特征指导特定节点与边类型的注意力更新。
- 引入全局-局部注意力答案生成模块,通过结合全局上下文(问题、对象、文本)与局部OCR嵌入,迭代生成答案,用汇总特征替代<begin>标记以提升性能。
- 采用迭代解码机制,对OCR标记与通用词汇进行注意力计算,实现灵活的多标记答案生成。
- 利用一种新型上界评估方法,采用人工标注的真实OCR标签,以解耦推理性能与OCR质量的影响。
实验结果
研究问题
- RQ1如何通过显式建模视觉对象、OCR标记及其相互作用之间的关系,来提升TextVQA中的多模态推理能力?
- RQ2与标准注意力机制相比,集成问题感知图注意力机制在多模态VQA中的答案生成性能提升程度如何?
- RQ3随着OCR准确率的提高,推理模型的性能提升程度如何?所提模型是否从更高OCR质量中获得更大收益?
- RQ4当消除OCR错误后,TextVQA上推理性能的真实上限是多少?与人类表现相比如何?
- RQ5在开放词汇、多标记答案设置下(如TextVQA),生成式、迭代式答案生成机制是否能超越判别式基线方法?
主要发现
- SMA在TextVQA验证集上取得SOTA性能,ANLS得分为50.8%,超越所有非预训练模型,并在TextVQA Challenge 2020中排名第一。
- 在ST-VQA数据集上,SMA在前两个任务(强上下文与弱上下文)中均取得SOTA,ANLS得分分别为0.483和0.486,在开放词汇任务中也表现具有竞争力。
- 在真实OCR标签下,SMA在TextVQA上达到68.81%的上界准确率,表明其推理能力仍远未达到人类水平。
- 使用真实OCR标签时,模型准确率提升9.68%,显著高于LoRRA(5.72%)与M4C(8.51%),表明其具备更强的推理与答案生成能力。
- 所提出的全局-局部注意力模块通过引入汇总的全局特征替代通用<begin>标记,在原始M4C基线上性能提升近0.5%。
- SBD-Trans OCR优于Rosetta-ml与Rosetta-en,Hmean达0.5244;使用该OCR模型的模型性能提升更显著,尤其SMA从OCR质量提升中获益最多。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。