[论文解读] DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding
DocPedia 提出了一种新颖的大规模多模态模型,通过在频域中直接使用 DCT 系数处理高分辨率文档图像,实现了无需 OCR 的优越感知与理解能力。通过采用双阶段训练策略和频域视觉编码,该模型在 DocVQA 和 TextVQA 等基准测试中达到最先进性能,尤其在 2,560×2,560 分辨率下表现突出。
This work presents DocPedia, a novel large multimodal model (LMM) for versatile OCR-free document understanding, capable of parsing images up to 2,560$ imes$2,560 resolution. Unlike existing work either struggle with high-resolution documents or give up the large language model thus vision or language ability constrained, our DocPedia directly processes visual input in the frequency domain rather than the pixel space. The unique characteristic enables DocPedia to capture a greater amount of visual and textual information using a limited number of visual tokens. To consistently enhance both perception and comprehension abilities of our model, we develop a dual-stage training strategy and enrich instructions/annotations of all training tasks covering multiple document types. Extensive quantitative and qualitative experiments conducted on various publicly available benchmarks confirm the mutual benefits of jointly learning perception and comprehension tasks. The results provide further evidence of the effectiveness and superior performance of our DocPedia over other methods.
研究动机与目标
- 解决现有无 OCR 文档理解模型在视觉(低分辨率输入)或语言(轻量解码器)方面的局限性。
- 克服文档理解中高分辨率视觉感知与稳健语言理解之间的权衡。
- 实现大语言模型(LLMs)在推理和世界知识应用方面的有效利用,同时保留高分辨率文档中的细粒度视觉细节。
- 开发一种联合优化感知与理解能力的训练策略,以实现多功能文档理解。
- 探索使用频域表示作为多模态模型中视觉编码器替代像素空间输入的可行性。
提出的方法
- 通过 JPEG DCT 处理文档图像,提取频域系数作为视觉编码器的输入,减少 token 数量的同时保留关键视觉与文本信息。
- 引入频域适配器,弥合 DCT 系数与视觉编码器之间的差距,实现在频域中的有效特征学习。
- 采用双阶段训练策略:首先在图像-文本对上使用对比学习预训练视觉编码器,然后联合微调感知(OCR、图像字幕)与理解(VQA、文档理解)任务。
- 使用大语言模型(LLM)基于合并的视觉 token(来自频域)和指令衍生 token 生成响应,实现逻辑推理与世界知识的应用。
- 通过在多样化文档类型(包括收据、学术论文和表格)上使用丰富标注的指令和数据进行模型优化。
- 在推理阶段应用自适应形状裁剪策略,以处理极高分辨率输入,确保充分利用模型的高分辨率能力。
实验结果
研究问题
- RQ1图像的频域表示能否提升大规模多模态模型在高分辨率文档理解中的效率与性能?
- RQ2感知与理解任务的联合预训练与微调是否能相互促进模型能力的提升?
- RQ3与像素空间基线相比,频域输入管道在视觉 token 效率与分辨率可扩展性方面是否更具优势?
- RQ4与轻量解码器相比,使用完整 LLM 进行推理在复杂文档理解任务中的性能提升程度如何?
- RQ5该模型在极高分辨率或多页文档上的表现如何?其在这些场景下的局限性是什么?
主要发现
- 在 1,920×1,920 分辨率下,DocPedia 在 DocVQA 基准测试中取得 53.35% 的 VQA 得分,优于仅使用图像输入的方法。
- 在 2,560×2,560 分辨率下,DocPedia 能够对复杂查询生成准确响应,性能相比低分辨率显著提升。
- 频域输入策略使模型在相同分辨率下仅需像素空间输入约 1/4 的视觉 token 数量,仍能保持高性能。
- 消融实验表明,预训练至关重要——若省略预训练,性能将显著下降,凸显视觉-LLM 特征对齐的重要性。
- 在感知与理解任务上联合微调优于单独训练,证实了同步学习的相互增益。
- 该模型在文本定位与推理任务(如图 1 中的 Q3)中表现更优,尤其在高分辨率下,像素模型因下采样而失效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。