Skip to main content
QUICK REVIEW

[論文レビュー] Bi-VLDoc: Bidirectional Vision-Language Modeling for Visually-Rich Document Understanding

Chuwei Luo, Guozhi Tang|arXiv (Cornell University)|Jun 27, 2022
Handwritten Text Recognition Techniques被引用数 6
ひとこと要約

Bi-VLDoc は、ハイブリッドアテンションメカニズムと 3 つの新しい事前学習タスク(BTIA、RWTP、TIPA)を活用して、視覚的リッチドキュメント理解のための双方向ビジョン・ランゲージ事前学習フレームワークを提案する。この手法はフォーム理解(93.44%)、レシート情報抽出(97.84%)、ドキュメント分類(97.12%)、ドキュメント視覚的QAで最先端の性能を達成し、従来モデルを最大1.26%上回る。

ABSTRACT

Multi-modal document pre-trained models have proven to be very effective in a variety of visually-rich document understanding (VrDU) tasks. Though existing document pre-trained models have achieved excellent performance on standard benchmarks for VrDU, the way they model and exploit the interactions between vision and language on documents has hindered them from better generalization ability and higher accuracy. In this work, we investigate the problem of vision-language joint representation learning for VrDU mainly from the perspective of supervisory signals. Specifically, a pre-training paradigm called Bi-VLDoc is proposed, in which a bidirectional vision-language supervision strategy and a vision-language hybrid-attention mechanism are devised to fully explore and utilize the interactions between these two modalities, to learn stronger cross-modal document representations with richer semantics. Benefiting from the learned informative cross-modal document representations, Bi-VLDoc significantly advances the state-of-the-art performance on three widely-used document understanding benchmarks, including Form Understanding (from 85.14% to 93.44%), Receipt Information Extraction (from 96.01% to 97.84%), and Document Classification (from 96.08% to 97.12%). On Document Visual QA, Bi-VLDoc achieves the state-of-the-art performance compared to previous single model methods.

研究の動機と目的

  • 既存のドキュメント事前学習モデルにおける双方向クロスモーダル相互作用の限界を解消すること。
  • 視覚と言語の両モダリティからの監視信号を活用して、クロスモーダル表現学習を向上させること。
  • 細分化された位置レベルのアテンションとアライメントを用いて、レイアウトに配慮した理解を強化すること。
  • 視覚的リッチドキュメント理解の複数のベンチマークで最先端の性能を達成すること。
  • ドキュメントAIにおけるテキスト、レイアウト、視覚特徴のより効果的な統合モデリングを可能にすること。

提案手法

  • 視覚と言語モダリティの間で相互監視を可能にする双方向ビジョン・ランゲージ監視戦略を導入する。
  • 表現学習中にクロスモーダル特徴を動的に統合するため、ビジョン・ランゲージハイブリッドアテンションメカニズムを提案する。
  • 3 つの新しい事前学習タスク(BTIA(双方向テキスト・イメージアライメント)、RWTP(領域別テキスト予測)、TIPA(テキスト・イメージ位置認識))を設計する。
  • RWTP を用いて、言語から得た監視信号を活用してテキストトークンと対応する視覚的領域を再構築することで、視覚的特徴とテキスト内容のアライメントを実現する。
  • TIPA を用いて、断片的または複数領域に散らばったテキストブロックに対しても、正確で位置に配慮したテキストから画像へのアテンションを可能にする。
  • スパン抽出のためのトークンレベル分類器を用いて、テキスト・視覚・レイアウト埋め込みの統一シーケンスを用いて、微調整を実施する。

実験結果

リサーチクエスチョン

  • RQ1双方向ビジョン・ランゲージ監視は、視覚的リッチドキュメント理解におけるクロスモーダル表現学習を向上させることができるか?
  • RQ2言語から得た監視信号を用いた視覚的再構築は、テキスト内容と一致する視覚的特徴のアライメントをどのように向上させるか?
  • RQ3細分化されたレイアウト認識は、ドキュメントレベルのタスクにおける性能向上にどの程度寄与するか?
  • RQ4ハイブリッドアテンションメカニズムは、より良いドキュメント理解のための視覚と言語特徴を効果的に統合できるか?
  • RQ5双方向の目的関数を用いた統合的事前学習は、多様なドキュメント理解ベンチマークで一貫した最先端性能を達成できるか?

主な発見

  • フォーム理解では 93.44% の F1 スコアを達成し、従来の最先端手法(85.14%)と比較して 8.3% の向上を示した。
  • レシート情報抽出では 97.84% の F1 スコアを達成し、従来の最先端手法(96.01%)を上回った。
  • ドキュメント分類では 97.12% の正答率を達成し、従来の最先端手法(96.08%)を上回った。
  • ドキュメント視覚的QAでは ANLS スコアが 84.70 に達し、LayoutLM v2 よりも 1.26 パcent point 高かった。
  • 可視化結果から、Bi-VLDoc はテキストと視覚的トークンがお互いに注目するクロスアテンションパターンを学習していることが確認された。これは、LayoutLM v2 が示す単方向アテンションとは対照的である。
  • 事例研究では、Bi-VLDoc が HEADER などのエンティティを、対応する視覚的領域とテキストトークンをアライメントさせることで正しく特定している一方、LayoutLM v2 はこのような状況で失敗している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。