[论文解读] VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents
VisRAG 提出了一种基于视觉的检索增强生成框架,通过直接使用文档图像作为视觉语言模型(VLM)驱动的检索器和生成器的输入,绕过了文本解析。通过保留完整的视觉和布局信息,VisRAG 在端到端性能上比基于文本的 RAG 提高了 25–39%,尤其在对布局敏感的任务中表现优异,因为文本解析会导致信息丢失。
Retrieval-augmented generation (RAG) is an effective technique that enables large language models (LLMs) to utilize external knowledge sources for generation. However, current RAG systems are solely based on text, rendering it impossible to utilize vision information like layout and images that play crucial roles in real-world multi-modality documents. In this paper, we introduce VisRAG, which tackles this issue by establishing a vision-language model (VLM)-based RAG pipeline. In this pipeline, instead of first parsing the document to obtain text, the document is directly embedded using a VLM as an image and then retrieved to enhance the generation of a VLM. Compared to traditional text-based RAG, VisRAG maximizes the retention and utilization of the data information in the original documents, eliminating the information loss introduced during the parsing process. We collect both open-source and synthetic data to train the retriever in VisRAG and explore a variety of generation methods. Experiments demonstrate that VisRAG outperforms traditional RAG in both the retrieval and generation stages, achieving a 20--40% end-to-end performance gain over traditional text-based RAG pipeline. Further analysis reveals that VisRAG is efficient in utilizing training data and demonstrates strong generalization capability, positioning it as a promising solution for RAG on multi-modality documents. Our code and data are available at https://github.com/openbmb/visrag.
研究动机与目标
- 解决基于文本的 RAG 在多模态文档中因解析导致信息丢失和忽略版式线索的局限性。
- 探究视觉语言模型(VLM)是否能直接替代基于文本的检索与生成流水线,而无需中间的文本提取步骤。
- 开发一种纯视觉的 RAG 流水线,以保留原始文档结构和视觉语义,从而提升检索与生成效果。
- 评估基于 VLM 的检索与生成在真实世界多模态文档(包括复杂布局和图表)上的有效性。
- 证明该方法在多种文档类型和查询场景下的泛化能力与鲁棒性。
提出的方法
- VisRAG 使用基于 VLM 的检索器(VisRAG-Ret),通过视觉编码器 token 的加权平均池化直接嵌入文档图像,绕过 OCR 和文本解析。
- 检索器采用双编码器架构,将查询和文档图像映射到共享嵌入空间,实现密集检索。
- 在生成阶段,VisRAG-Gen 使用 VLM 基于检索到的文档图像生成答案,通过页面拼接支持多图像输入,并采用加权选择策略以适配单图像输入的模型。
- 该框架在开源 VQA 数据集与从网络爬取的 PDF 衍生的合成查询-文档对组合数据上进行训练。
- 整个流程中保留了版式与视觉上下文,从而能够准确理解空间关系与文档结构。
- 系统支持单图像与多图像 VLM,通过自适应处理在检索与生成过程中保持视觉保真度。
实验结果
研究问题
- RQ1基于视觉语言模型的 RAG 流水线是否能在多模态文档理解任务中超越传统的基于文本的 RAG?
- RQ2与基于文本解析的流水线相比,保留视觉版式与图像内容在多大程度上提升了检索与生成的准确性?
- RQ3在文本提取因字体或格式问题而失败的版式敏感查询中,VisRAG 的表现如何?
- RQ4与级联解析流水线相比,检索阶段直接使用图像是否能减少信息丢失?
- RQ5VisRAG 是否能在多样化的文档类型(包括信息图、手册和表格)中实现泛化,且对文本内容的依赖程度极低?
主要发现
- 在多模态文档基准测试中,VisRAG 相较于传统基于文本的 RAG 流水线,实现了 25–39% 的端到端性能提升。
- 在版式敏感任务中,例如识别与特定区域(如欧洲 vs. 英国)关联的百分比,VisRAG 正确识别出欧洲的占比为 53%,而 TextRAG 因解析导致的版式混淆而失败。
- 当目标术语(如“Club Jetty”)被装饰性字体遮挡时,VisRAG 仍能成功检索到相关文档,而 TextRAG 因无法提取该文本而无法检索。
- 即使在相同训练条件下,基于 VLM 的检索器也优于最先进的基于文本和基于视觉的检索器。
- 使用 GPT-4o 时,VisRAG 的性能随着使用更多检索文档而持续提升,表明其在多文档上下文下具有强大的可扩展性。
- VisRAG 展现出强大的泛化能力与对训练数据的有效利用,表明其在多种文档布局与视觉结构下均具有鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。