[论文解读] TAP: Text-Aware Pre-training for Text-VQA and Text-Caption
本文提出文本感知预训练(TAP),一种显式地将OCR提取的场景文本整合到视觉-语言预训练中的方法,以提升文本-VQA和文本字幕任务的多模态表征学习。通过引入三种新型预训练任务——掩码语言建模、图文匹配和相对空间位置预测,TAP显著增强了文本词、视觉对象与场景文本之间的对齐,当在大规模OCR-CC数据集上预训练时,在TextVQA任务上实现+8.3%的准确率提升,在TextCaps任务上实现+10.2 CIDEr的性能提升,达到当前最优水平。
In this paper, we propose Text-Aware Pre-training (TAP) for Text-VQA and Text-Caption tasks. These two tasks aim at reading and understanding scene text in images for question answering and image caption generation, respectively. In contrast to the conventional vision-language pre-training that fails to capture scene text and its relationship with the visual and text modalities, TAP explicitly incorporates scene text (generated from OCR engines) in pre-training. With three pre-training tasks, including masked language modeling (MLM), image-text (contrastive) matching (ITM), and relative (spatial) position prediction (RPP), TAP effectively helps the model learn a better aligned representation among the three modalities: text word, visual object, and scene text. Due to this aligned representation learning, even pre-trained on the same downstream task dataset, TAP already boosts the absolute accuracy on the TextVQA dataset by +5.4%, compared with a non-TAP baseline. To further improve the performance, we build a large-scale dataset based on the Conceptual Caption dataset, named OCR-CC, which contains 1.4 million scene text-related image-text pairs. Pre-trained on this OCR-CC dataset, our approach outperforms the state of the art by large margins on multiple tasks, i.e., +8.3% accuracy on TextVQA, +8.6% accuracy on ST-VQA, and +10.2 CIDEr score on TextCaps.
研究动机与目标
- 为解决传统视觉-语言预训练在捕捉场景文本及其与视觉和文本模态关系方面的局限性。
- 提升下游文本-VQA和文本字幕任务中,文本词、视觉对象与场景文本之间的联合表征学习能力。
- 开发一种显式地将OCR提取的场景文本作为额外输入模态的预训练框架。
- 构建一个大规模、富含场景文本的图文数据集(OCR-CC),以进一步提升模型性能。
提出的方法
- 在预训练过程中,将来自OCR的场景文本标记及其对应的视觉边界框作为额外输入模态进行整合。
- 提出一种掩码语言建模(MLM)任务,将场景文本标记包含在掩码输入中,以增强跨模态对齐。
- 设计一种图文匹配(ITM)任务,用于评估包含场景文本的图像与文本输入之间的相关性。
- 引入一种相对(空间)位置预测(RPP)任务,以学习场景文本与视觉对象之间的空间关系。
- 在新构建的大规模数据集OCR-CC上预训练模型,该数据集包含140万对与场景文本相关的图文样本。
- 使用带有交叉注意力机制的多模态Transformer,学习文本词、视觉对象与场景文本区域之间的潜在对齐关系。
实验结果
研究问题
- RQ1在预训练阶段显式引入场景文本是否能提升文本-VQA和文本字幕任务的多模态表征学习?
- RQ2在包含场景文本的预训练中,文本词、视觉对象与场景文本区域之间的对齐关系受到何种影响?
- RQ3与标准视觉-语言数据集相比,在大规模、富含场景文本的数据集(OCR-CC)上进行预训练会产生何种影响?
- RQ4所提出的预训练任务(MLM、ITM、RPP)对下游性能的贡献程度如何?
- RQ5TAP能否纠正仅依赖视觉与文本模态对齐的非TAP模型所出现的失败案例?
主要发现
- 当在相同下游数据上进行预训练和微调时,TAP相较于非TAP基线模型,在TextVQA数据集上实现了+5.4%的绝对准确率提升。
- 在OCR-CC数据集上预训练后,TAP在TextVQA任务上实现+8.3%的准确率提升,超越了先前的最先进方法。
- TAP在ST-VQA任务上提升+8.6%,在TextCaps任务上提升+10.2 CIDEr,表明其在不同任务间具有强大的泛化能力。
- 共指消融分析显示,场景文本与语言的对齐程度提升了七倍,与视觉的对齐程度提升了两倍,验证了联合表征学习的显著改善。
- 定性结果表明,TAP能正确处理改写问题、通过中间对象引用场景文本,以及复杂的时空关系。
- TAP能成功定位长文本跨度中的多个场景文本标记,从而支持对多词实体查询的准确答案生成。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。