Skip to main content
QUICK REVIEW

[논문 리뷰] Unifying Vision, Text, and Layout for Universal Document Processing

Zineng Tang, Ziyi Yang|arXiv (Cornell University)|2022. 12. 05.
Handwritten Text Recognition Techniques인용 수 8
한 줄 요약

UDOP는 비전, 텍스트, 레이아웃 모odal을 통합하는 기초 모델로, 비전-텍스트-레이아웃 트랜스포머와 프롬프트 기반의 시퀀스-투-시퀀스 프레임워크를 사용하여 문서 AI에서 통합된 접근 방식을 제공한다. 이는 문서 질문 응답 및 레이아웃 분석을 포함한 8개의 문서 AI 작업에서 최신 기술 수준의 성능을 달성하며, 분야에서 처음으로 고품질이고 사용자 정의 가능한 문서 생성 및 편집을 가능하게 한다.

ABSTRACT

We propose Universal Document Processing (UDOP), a foundation Document AI model which unifies text, image, and layout modalities together with varied task formats, including document understanding and generation. UDOP leverages the spatial correlation between textual content and document image to model image, text, and layout modalities with one uniform representation. With a novel Vision-Text-Layout Transformer, UDOP unifies pretraining and multi-domain downstream tasks into a prompt-based sequence generation scheme. UDOP is pretrained on both large-scale unlabeled document corpora using innovative self-supervised objectives and diverse labeled data. UDOP also learns to generate document images from text and layout modalities via masked image reconstruction. To the best of our knowledge, this is the first time in the field of document AI that one model simultaneously achieves high-quality neural document editing and content customization. Our method sets the state-of-the-art on 8 Document AI tasks, e.g., document understanding and QA, across diverse data domains like finance reports, academic papers, and websites. UDOP ranks first on the leaderboard of the Document Understanding Benchmark.

연구 동기 및 목표

  • 공간적 상관관계를 활용하여 문서 AI에서 비전, 텍스트, 레이아웃 모달을 통합한다.
  • 다양한 도메인의 다양한 문서 작업을 처리할 수 있는 단일 통합 모델 아키텍처를 개발한다.
  • 텍스트, 비전, 레이아웃을 함께 모델링하여 통합된 문서 표현을 위한 새로운 자기지도 사전학습 목표를 설계한다.
  • 통합 생성 프레임워크를 사용하여 고품질이고 사용자 정의 가능한 문서 편집 및 생성을 가능하게 한다.
  • 문서 이해 및 레이아웃 분석을 포함한 다양한 문서 AI 벤치마크에서 최신 기술 수준의 성능을 달성한다.

제안 방법

  • UDOP는 텍스트가 나타나는 위치에서 텍스트 토큰 임베딩과 이미지 패치 특징을 융합하는 레이아웃 유도 표현을 사용하여 다중모달 상호작용을 향상시킨다.
  • 모달리티에 관계없이 작동하는 인코더, 텍스트-레이아웃 디코더, 비전 디코더를 갖춘 비전-텍스트-레이아웃(VTL) 트랜스포머를 도입하여 세 가지 모달을 동시에 인코딩하고 디코딩한다.
  • 모든 후행 작업에 대해 통합된 시퀀스-투-시퀀스 생성 프레임워크를 사용하며, 작업별 목적을 정의하기 위해 프롬프트 기반 입력을 활용한다.
  • UDOP는 새로운 자기지도 사전학습 목표를 사용하여 사전학습한다: 공동 텍스트-레이아웃 복원, 시각적 텍스트 인식, 레이아웃 모델링, 및 마스킹된 이미지 복원(MAE).
  • 마스킹된 오토인코딩을 통해 텍스트와 레이아웃에서 문서 이미지를 생성하도록 학습하여 현실적인 문서 편집 및 맞춤화를 가능하게 한다.
  • 모델은 지도 학습 데이터로 미세조정되며, 보조 QA 데이터셋에서 추가 사전학습을 통해 제로샷 일반화 성능이 향상된다.
Figure 1 : UDOP unifies vision, text, and layout through vision-text-layout Transformer and unified generative pretraining tasks including vision task, text task, layout task, and mixed task. We show the task prompts (left) and task targets (right) for all self-supervised objectives (joint text-layo
Figure 1 : UDOP unifies vision, text, and layout through vision-text-layout Transformer and unified generative pretraining tasks including vision task, text task, layout task, and mixed task. We show the task prompts (left) and task targets (right) for all self-supervised objectives (joint text-layo

실험 결과

연구 질문

  • RQ1공간적 상관관계를 활용하여 UDOP가 문서 AI에서 비전, 텍스트, 레이아웃 모달을 효과적으로 통합할 수 있는가?
  • RQ2단일 생성 프레임워크가 질문 응답, 레이아웃 분석, 정보 추출과 같은 다양한 문서 작업을 통합할 수 있는가?
  • RQ3텍스트, 비전, 레이아웃을 함께 모델링하는 새로운 자기지도 사전학습 목표가 통합된 문서 표현에 얼마나 효과적인가?
  • RQ4통합 모델이 이전에는 달성되지 못했던 고품질이고 사용자 정의 가능한 문서 생성 및 편집을 달성할 수 있는가?
  • RQ5비전 모달이 시각적으로 rich한 문서 작업과 텍스트 중심의 문서 작업에서 성능 향상에 얼마나 기여하는가?

주요 결과

  • UDOP는 문서 질문 응답(85.0 ± 0.2, DocVQA) 및 레이아웃 분석(96.3 ± 0.1, RVL-CDIP)을 포함한 8개의 문서 AI 작업에서 최신 기술 수준의 성능을 달성한다.
  • 마스킹된 이미지 복원과 지도 학습 사전학습이 포함된 경우, MLM 전용 사전학습 대비 DocVQA와 RVL-CDIP에서 각각 0.6점, 0.6점 향상된다.
  • 보조 QA 데이터셋에서 미세조정했을 때, UDOP는 DocVQA(87.8 vs. 87.1)와 InfographicsVQA(63.0 vs. 61.2)에서 TILT를 모두 앞서나간다.
  • 비전 모달은 시각적으로 rich한 작업에서 성능 향상에 크게 기여한다: 이미지 임베딩을 제거하면 InfographicsVQA에서 성능이 2.4점 감소하지만, DocVQA에서는 뿐만 0.3점 감소한다.
  • UDOP의 통합 인코더 아키텍처는 대부분의 벤치마크에서 모달리티별로 별도의 이중 인코더 버전인 UDOP-Dual보다 우수한 성능을 보이며, 공동 표현 학습의 이점을 입증한다.
  • UDOP는 문서 AI 분야에서 고품질이고 사용자 정의 가능한 문서 편집 및 생성을 처음으로 달성한 모델로, 텍스트와 레이아웃 입력에서 현실적인 이미지 복원을 가능하게 한다.
Figure 2 : Layout-induced vision-text embedding.
Figure 2 : Layout-induced vision-text embedding.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.