Skip to main content
QUICK REVIEW

[論文レビュー] Donut: Document Understanding Transformer without OCR

Geewook Kim, Teakgyu Hong|arXiv (Cornell University)|Nov 30, 2021
Handwritten Text Recognition Techniques参考文献 55被引用数 15
ひとこと要約

本論文では、OCRを完全に回避する視覚言語トランスフォーマー、Donutを提案する。合成ドキュメント画像生成器を用いた事前学習により、エンドツーエンドのモデルが公開および産業界のベンチマークで最先端の性能を達成した。OCR関連の計算コストや誤差伝搬を排除した。

ABSTRACT

Understanding document images (e.g., invoices) has been an important research topic and has many applications in document processing automation. Through the latest advances in deep learning-based Optical Character Recognition (OCR), current Visual Document Understanding (VDU) systems have come to be designed based on OCR. Although such OCR-based approach promise reasonable performance, they suffer from critical problems induced by the OCR, e.g., (1) expensive computational costs and (2) performance degradation due to the OCR error propagation. In this paper, we propose a novel VDU model that is end-to-end trainable without underpinning OCR framework. To this end, we propose a new task and a synthetic document image generator to pre-train the model to mitigate the dependencies on large-scale real document images. Our approach achieves state-of-the-art performance on various document understanding tasks in public benchmark datasets and private industrial service datasets. Through extensive experiments and analysis, we demonstrate the effectiveness of the proposed model especially with consideration for a real-world application.

研究の動機と目的

  • OCRベースの視覚ドキュメント理解(VDU)システムに内在する高い計算コストと誤差伝搬を解消すること。
  • 事前学習に合成ドキュメント画像生成器を導入することで、大規模な実ドキュメントデータセットへの依存を低減すること。
  • OCRパイプラインを経由せずに、ドキュメント画像そのものに直接対処できるエンドツーエンドでトレーニング可能なVDUモデルの開発。
  • 公開ベンチマークおよびプライベート産業界データセットの両方で最先端の性能を達成すること。
  • 実世界のドキュメント処理アプリケーションにおける実用的効果を実証すること。

提案手法

  • OCRを用いずに、ドキュメントの構造と意味を学習できる、ドキュメント画像からテキストを生成する新しい事前学習タスクを提案する。
  • 視覚言語モデルの事前学習に適した多様で現実的である訓練データを生成するため、合成ドキュメント画像生成器を設計する。
  • 合成および実ドキュメント画像上でエンドツーエンドに訓練されたビジョン・ランゲージトランスフォーマーを採用し、画像を構造化されたテキスト出力に直接マッピングする。
  • 高価な実世界のアノテート済みドキュメントデータセットへの依存を低減するため、合成データ上で自己教師あり事前学習を活用する。
  • 視覚的特徴と対応するテキストトークンを、自己回帰的に同時にエンコードするトランスフォーマーに基づくアーキテクチャを採用する。
  • 限られた実世界のラベル付きデータを用いて、下流のドキュメント理解タスクでモデルをファインチューニングする。

実験結果

リサーチクエスチョン

  • RQ1OCRに依存せずに、ビジョン・ランゲージトランスフォーマーがドキュメント理解で高い性能を達成できるか?
  • RQ2合成データ生成が、実世界への展開を想定したドキュメント理解モデルの事前学習にどの程度有効か?
  • RQ3OCRを排除することで、ドキュメント理解システムにおける計算コストと誤差伝搬が低下するか?
  • RQ4本手法は、公開および非公開のベンチマークの両方でOCRベースのベースラインと比較して優れているか?
  • RQ5本モデルは、実世界の産業界ドキュメント処理シナリオにどの程度一般化可能か?

主な発見

  • Donutは、OCRを一切使用せずに、複数の公開ドキュメント理解ベンチマークで最先端の性能を達成した。
  • OCRパイプラインを排除することで、従来のVDUシステムにおける主要なボトルネックであった計算コストを顕著に低減した。
  • OCR由来の誤差伝搬が完全に回避され、低品質または複雑なドキュメント画像においてもより頑健な予測が可能になった。
  • 合成データによる事前学習戦略のおかげで、限られた実世界のラベル付きデータでも強力な性能が得られた。
  • プライベート産業界データセットに対しても、強力な一般化性能を示し、実用的応用の有効性を確認した。
  • 広範なアブレーションスタディにより、合成データ生成とエンドツーエンド学習パラダイムの有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。