Skip to main content
QUICK REVIEW

[论文解读] UReader: Universal OCR-free Visually-situated Language Understanding with Multimodal Large Language Model

Jiabo Ye, Anwen Hu|arXiv (Cornell University)|Oct 8, 2023
Multimodal Machine Learning Applications被引用 4
一句话总结

UReader 提出了一种通用的、无需 OCR 的视觉定位语言理解框架,通过在多模态大语言模型(MLLM)上进行指令微调,实现了在 10 项任务中的 8 项的最先进性能,且无需下游微调。该方法利用一种自适应形状的裁剪模块,结合冻结的低分辨率视觉编码器处理高分辨率图像,并通过少量参数更新的辅助文本阅读和关键点生成任务,增强文本与语义理解能力。

ABSTRACT

Text is ubiquitous in our visual world, conveying crucial information, such as in documents, websites, and everyday photographs. In this work, we propose UReader, a first exploration of universal OCR-free visually-situated language understanding based on the Multimodal Large Language Model (MLLM). By leveraging the shallow text recognition ability of the MLLM, we only finetuned 1.2% parameters and the training cost is much lower than previous work following domain-specific pretraining and finetuning paradigms. Concretely, UReader is jointly finetuned on a wide range of Visually-situated Language Understanding tasks via a unified instruction format. To enhance the visual text and semantic understanding, we further apply two auxiliary tasks with the same format, namely text reading and key points generation tasks. We design a shape-adaptive cropping module before the encoder-decoder architecture of MLLM to leverage the frozen low-resolution vision encoder for processing high-resolution images. Without downstream finetuning, our single model achieves state-of-the-art ocr-free performance in 8 out of 10 visually-situated language understanding tasks, across 5 domains: documents, tables, charts, natural images, and webpage screenshots. Codes and instruction-tuning datasets will be released.

研究动机与目标

  • 实现对文档、表格、图表、自然图像和网页等多种图像类型中通用的、无需 OCR 的视觉定位语言理解。
  • 通过避免领域特定预训练,转而使用冻结 MLLM 的低成本指令微调,降低训练成本。
  • 通过辅助指令微调任务(文本阅读与关键点生成)提升视觉-语言任务中的文本识别与语义理解能力。
  • 通过自适应形状裁剪模块,有效利用冻结的低分辨率视觉编码器处理高分辨率图像,同时保持文本完整性。
  • 在无需任何下游微调的情况下,实现 10 项基准任务中的最先进性能。

提出的方法

  • 将所有视觉定位语言理解任务统一转化为指令微调格式,以实现在单一 MLLM 上的联合微调。
  • 引入两项辅助任务——文本阅读与关键点生成,采用相同的指令格式,以增强视觉-文本与语义理解能力。
  • 设计一种自适应形状裁剪模块,根据图像的宽高比将高分辨率图像分割为局部图像块,保持文本清晰度并减少失真。
  • 对每个裁剪图像块应用可学习的视觉抽象器,并拼接其特征,同时引入可学习的裁剪位置嵌入以保持空间感知能力。
  • 将缩放后的全局图像与裁剪特征一同输入,以缓解裁剪带来的信息损失。
  • 仅更新 1.2% 的参数对 MLLM 进行微调,与以往领域特定预训练方法相比,显著降低了训练成本。

实验结果

研究问题

  • RQ1单一 MLLM 是否能在无需领域特定预训练的情况下,实现对多样化领域中通用的、无需 OCR 的视觉定位语言理解?
  • RQ2在视觉-语言任务中,结合辅助任务的指令微调在提升文本识别与语义理解方面有多高效?
  • RQ3自适应形状裁剪策略是否能有效利用冻结的低分辨率视觉编码器进行高分辨率图像理解?
  • RQ4该模型在不同图像类型(包括文档、表格、图表、自然图像和网页)上的泛化能力如何?
  • RQ5与以往方法相比,该模型在无需 OCR 的准确率与训练效率方面表现如何?

主要发现

  • UReader 在 10 项视觉定位语言理解任务中的 8 项上实现了最先进性能,且无需任何下游微调,覆盖 5 个领域。
  • 与固定网格裁剪相比,自适应形状裁剪模块将文本阅读性能提升了 3.5 个 BLEU 分数(从 21.4 提升至 24.9 BLEU1),有效减少了文本失真。
  • 辅助文本阅读任务显著增强了模型从图像中提取和重构文本序列的能力,在测试集上达到 11.7 的 BLEU4 分数。
  • 模型展现出强大的零样本泛化能力,能够通过关注相关区域,准确回答关于表格的复杂问题,如识别首部电影或计算总和。
  • UReader 在图表上成功实现了开放式关键点生成,但性能受限于幻觉生成与对复杂视觉结构理解不充分的问题。
  • 模型仅微调 1.2% 的参数,实现了高效率,训练成本显著低于以往的端到端或两阶段方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。