Skip to main content
QUICK REVIEW

[論文レビュー] Unifying Vision, Text, and Layout for Universal Document Processing

Zineng Tang, Ziyi Yang|arXiv (Cornell University)|Dec 5, 2022
Handwritten Text Recognition Techniques被引用数 8
ひとこと要約

UDOP は、ビジョン・テキスト・レイアウトの3モodalities を統合する基礎モデルであり、ビジョン・テキスト・レイアウト変換器とプロンプトベースのシーケンス・ツー・シーケンス枠組みを用いてドキュメントAIにおける統合的アプローチを実現する。8つのドキュメントAIタスクにおいて最先端の性能を達成しており、ドキュメント質問応答やレイアウト解析を含む。また、本番分野で初めて、高品質でカスタマイズ可能なドキュメント生成と編集を可能にする。

ABSTRACT

We propose Universal Document Processing (UDOP), a foundation Document AI model which unifies text, image, and layout modalities together with varied task formats, including document understanding and generation. UDOP leverages the spatial correlation between textual content and document image to model image, text, and layout modalities with one uniform representation. With a novel Vision-Text-Layout Transformer, UDOP unifies pretraining and multi-domain downstream tasks into a prompt-based sequence generation scheme. UDOP is pretrained on both large-scale unlabeled document corpora using innovative self-supervised objectives and diverse labeled data. UDOP also learns to generate document images from text and layout modalities via masked image reconstruction. To the best of our knowledge, this is the first time in the field of document AI that one model simultaneously achieves high-quality neural document editing and content customization. Our method sets the state-of-the-art on 8 Document AI tasks, e.g., document understanding and QA, across diverse data domains like finance reports, academic papers, and websites. UDOP ranks first on the leaderboard of the Document Understanding Benchmark.

研究の動機と目的

  • 空間的相関を活用することで、ドキュメントAIにおけるビジョン・テキスト・レイアウトの3モダリティを統合すること。
  • 複数のドメインにまたがる多様なドキュメントタスクを処理できる、単一の統合モデルアーキテクチャの開発。
  • テキスト・ビジョン・レイアウトを統合的にモデル化する新しい自己教師付き事前学習目的の設計。
  • 統合的生成フレームワークを用いて、高品質でカスタマイズ可能なドキュメント編集と生成を可能にすること。
  • ドキュメント理解とレイアウト解析を含む、多様なドキュメントAIベンチマークで最先端の性能を達成すること。

提案手法

  • UDOP は、テキストが表示される位置における画像パッチ特徴とテキストトークン埋め込みを統合するレイアウト誘導表現を採用し、クロスマodal相互作用を強化する。
  • モダリティに依存しないエンコーダ、テキスト・レイアウトデコーダ、ビジョンデコーダを備えたビジョン・テキスト・レイアウト(VTL)変換器を導入し、3つのモダリティを統合的にエンコード・デコードする。
  • すべての下流タスクに統一されたシーケンス・ツー・シーケンス生成フレームワークを採用し、プロンプトベースの入力を用いてタスク固有の目的を定義する。
  • UDOP は、新しい自己教師付き事前学習目的(共同テキスト・レイアウト再構築、ビジュアルテキスト認識、レイアウトモデリング、マスキング画像再構築(MAE))を用いて事前学習を行う。
  • マスキング自己符号化を用いて、テキストとレイアウトからドキュメント画像を生成する能力を学習し、リアルなドキュメント編集とカスタマイズを可能にする。
  • 教師ありデータで微調整し、補助QAデータセットでの追加事前学習により、ゼロショット一般化性能が向上する。
Figure 1 : UDOP unifies vision, text, and layout through vision-text-layout Transformer and unified generative pretraining tasks including vision task, text task, layout task, and mixed task. We show the task prompts (left) and task targets (right) for all self-supervised objectives (joint text-layo
Figure 1 : UDOP unifies vision, text, and layout through vision-text-layout Transformer and unified generative pretraining tasks including vision task, text task, layout task, and mixed task. We show the task prompts (left) and task targets (right) for all self-supervised objectives (joint text-layo

実験結果

リサーチクエスチョン

  • RQ1空間的相関を活用することで、ビジョン・テキスト・レイアウトの3モダリティを統合する統一された基礎モデルは、ドキュメントAIにおいて効果的に機能するか?
  • RQ21つのジェネレーティブフレームワークは、質問応答、レイアウト解析、情報抽出といった多様なドキュメントタスクを統合できるか?
  • RQ3テキスト・ビジョン・レイアウトを統合的にモデル化する新しい自己教師付き目的は、包括的なドキュメント表現にどの程度効果的か?
  • RQ4統一されたモデルは、従来のドキュメントAIでは達成できなかった高品質でカスタマイズ可能なドキュメント生成と編集を実現できるか?
  • RQ5ビジョンモダリティは、視覚的に豊富なタスクとテキスト中心のタスクの両方で、性能向上にどの程度寄与するか?

主な発見

  • UDOP は、ドキュメント質問応答(DocVQA で 85.0 ± 0.2)やレイアウト解析(RVL-CDIP で 96.3 ± 0.1)を含む8つのドキュメントAIタスクで最先端の性能を達成した。
  • マスキング画像再構築と教師あり事前学習の導入により、MLMオンative学習に比べ、DocVQA と RVL-CDIP でそれぞれ 0.6 ポイントずつ性能が向上した。
  • 補助QAデータセットで微調整した場合、UDOP は TILT より DocVQA(87.8 対 87.1)および InfographicsVQA(63.0 対 61.2)の両方で優れた性能を示した。
  • ビジョンモダリティは視覚的に豊富なタスクでの性能向上に顕著に寄与した:画像埋め込みを削除すると、InfographicsVQA では 2.4 ポイント低下したが、DocVQA では僅か 0.3 ポイントの低下にとどまった。
  • UDOP の統合エンコーダアーキテクチャは、モダリティ固有のデュアルエンコーダ変種(UDOP-Dual)よりも多数のベンチマークで優れた性能を示し、共同表現学習の利点を示している。
  • UDOP は、本番分野で初めて、テキストとレイアウト入力から高品質でカスタマイズ可能なドキュメント編集と生成を実現した。テキストとレイアウトからリアルな画像再構築が可能になった。
Figure 2 : Layout-induced vision-text embedding.
Figure 2 : Layout-induced vision-text embedding.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。