Skip to main content
QUICK REVIEW

[论文解读] PreSTU: Pre-Training for Scene-Text Understanding

Jihyung Kil, Soravit Changpinyo|arXiv (Cornell University)|Sep 12, 2022
Multimodal Machine Learning Applications被引用 5
一句话总结

PreSTU 提出了一种用于场景文本理解(STU)的新型预训练方法,通过直接从图像像素中引入与OCR相关的目标,增强了视觉-语言模型。在使用现成OCR工具处理大规模图像-文本数据进行训练时,PreSTU实现了最先进性能,包括在TextVQA上取得超过10%的绝对提升,以及在TextCaps上达到42 CIDEr得分,同时对噪声OCR输入保持鲁棒性,并且即使在推理阶段没有下游OCR信号的情况下依然有效。

ABSTRACT

The ability to recognize and reason about text embedded in visual inputs is often lacking in vision-and-language (V&L) models, perhaps because V&L pre-training methods have often failed to include such an ability in their training objective. In this paper, we propose PreSTU, a novel pre-training recipe dedicated to scene-text understanding (STU). PreSTU introduces OCR-aware pre-training objectives that encourage the model to recognize text from an image and connect it to the rest of the image content. We implement PreSTU using a simple transformer-based encoder-decoder architecture, combined with large-scale image-text datasets with scene text obtained from an off-the-shelf OCR system. We empirically demonstrate the effectiveness of this pre-training approach on eight visual question answering and four image captioning benchmarks.

研究动机与目标

  • 解决视觉-语言模型中场景文本理解(STU)缺乏显式预训练目标的问题。
  • 通过在预训练过程中直接将OCR识别出的文本与其视觉上下文关联,提升模型的鲁棒性和性能。
  • 证明即使在推理阶段OCR质量参差不齐或完全缺失的情况下,与OCR相关的预训练目标仍能提升下游STU任务的性能。
  • 研究预训练数据规模、图像分辨率以及OCR系统选择对STU模型有效性的影响。
  • 提供一种简单、高效且可扩展的预训练方法,使其在多种STU基准上优于现有方法。

提出的方法

  • PreSTU采用基于T5的Transformer编码器-解码器架构,视觉特征由直接应用于图像像素的ViT编码器提取,避免依赖冻结的目标检测器。
  • 模型同时处理图像像素和OCR标记,其中OCR输出与特定任务提示拼接,以实现上下文感知的文本理解。
  • 关键的预训练目标splitocr通过给定图像和部分OCR输出,训练模型预测缺失的场景文本部分,促进联合识别与上下文定位。
  • 额外的目标vqa和cap在下游任务特定的预训练中微调模型,进一步强化文本与上下文的联系。
  • 预训练利用大规模图像-文本数据集(如COCO、Conceptual Captions),通过Google Cloud OCR提取场景文本,实现可扩展且真实的训练。
  • 该方法在12个多样化的STU基准上进行评估,包括8项VQA和4项图像字幕任务,并对数据规模、分辨率和OCR系统鲁棒性进行了消融研究。

实验结果

研究问题

  • RQ1与OCR相关的预训练目标能否提升视觉-语言模型在视觉上下文中识别和定位场景文本的能力?
  • RQ2与标准视觉-语言预训练相比,使用任务无关的splitocr预训练目标如何提升下游STU性能?
  • RQ3当下游OCR系统质量不同时,或完全移除OCR信号时,PreSTU在多大程度上仍保持有效性?
  • RQ4预训练数据规模和图像分辨率如何影响STU模型的性能?
  • RQ5引入与OCR相关的预训练目标是否能提升模型在未见STU任务上的零样本迁移能力?

主要发现

  • 与强基线相比,PreSTU在TextVQA上实现了10.4%的绝对性能提升,显著增强了场景文本推理能力。
  • 在TextCaps基准上,PreSTU相比基线实现了42.0 CIDEr得分的提升,生成了更详细、更准确的场景文本字幕。
  • 零样本的splitocr→vqa目标在TextVQA上达到53.1%的准确率,无需任何微调,优于在相同数据上微调的监督型NoPreSTU基线。
  • 将预训练图像分辨率从224×224提升至640×640,使TextVQA准确率从47.1%提升至55.6%,凸显高分辨率视觉特征的重要性。
  • 将预训练数据规模从1%扩大到100%(共1300万样本),TextVQA准确率从42.3%提升至55.6%,表明数据规模具有显著收益。
  • 经过splitocr预训练的模型对下游OCR系统变化更具鲁棒性,在使用精度较低的OCR系统(如Rosetta)时仍优于基线,甚至在使用性能优于人工标注的TextOCR的gOCR系统时也表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。