Skip to main content
QUICK REVIEW

[論文レビュー] Towards a Multi-modal, Multi-task Learning based Pre-training Framework for Document Representation Learning

Subhojeet Pramanik, Shashank Mujumdar|arXiv (Cornell University)|Sep 30, 2020
Handwritten Text Recognition Techniques被引用数 9
ひとこと要約

本稿では、テキスト、レイアウト、画像特徴を統合的に符号化するためのマルチモーダルでマルチタスクの事前学習フレームワークを提案する。Longformerバックボーンを用いてマルチページドキュメントを効率的に処理する。ドキュメントトピックモデリングとドキュメントシャッフル予測という新しい自己教師付きタスクを導入することで、豊富なクロスモーダル表現を学習し、複数のベンチマークでドキュメント分類、情報抽出、リtrievalの分野で最先端の性能を達成する。

ABSTRACT

Recent approaches in literature have exploited the multi-modal information in documents (text, layout, image) to serve specific downstream document tasks. However, they are limited by their - (i) inability to learn cross-modal representations across text, layout and image dimensions for documents and (ii) inability to process multi-page documents. Pre-training techniques have been shown in Natural Language Processing (NLP) domain to learn generic textual representations from large unlabelled datasets, applicable to various downstream NLP tasks. In this paper, we propose a multi-task learning-based framework that utilizes a combination of self-supervised and supervised pre-training tasks to learn a generic document representation applicable to various downstream document tasks. Specifically, we introduce Document Topic Modelling and Document Shuffle Prediction as novel pre-training tasks to learn rich image representations along with the text and layout representations for documents. We utilize the Longformer network architecture as the backbone to encode the multi-modal information from multi-page documents in an end-to-end fashion. We showcase the applicability of our pre-training framework on a variety of different real-world document tasks such as document classification, document information extraction, and document retrieval. We evaluate our framework on different standard document datasets and conduct exhaustive experiments to compare performance against various ablations of our framework and state-of-the-art baselines.

研究の動機と目的

  • 既存のフレームワークがドキュメント内のテキスト、レイアウト、画像モダリティ間のクロスモーダル表現学習に限界を示しているのを是正すること。
  • 現実世界の応用で一般的なマルチページドキュメントから、エンドツーエンドのドキュメント表現学習を可能にすること。
  • 視覚的および構造的情報を活用する新しい自己教師付き事前学習タスクを導入することで、汎用的なドキュメント表現学習を向上させること。
  • 分類、情報抽出、リtrievalのような多様な下流ドキュメントタスクへの汎用性を実証すること。
  • 統一された事前学習パラダイムにおいてマルチモーダル入力とマルチタスク学習を組み合わせることで、既存の最先端モデルを上回ること。

提案手法

  • 長文シーケンスを線形アテンションスケーリングで効率的に処理できるように、Longformerアーキテクチャをバックボーンとして使用する。
  • テキストトークン、レイアウト用の2次元位置、テキストトークンの画像特徴(外観)、ページレベルの画像埋め込みの4つの埋め込みを用いてドキュメント情報を符号化する。
  • 視覚的および構造的表現学習を強化するため、ドキュメントトピックモデリング(DTM)とドキュメントシャッフル予測(DSP)という2つの新しい自己教師付き事前学習タスクを導入する。
  • これらのタスクを、既存の事前学習目的(マスク視覚的言語モデリング(MVLM)とドキュメント分類(CLF))と組み合わせ、マルチタスク学習の枠組みで統合する。
  • テキスト、レイアウト、画像モダリティ間のクロスモーダル相互作用と共有表現学習を可能にするために、エンドツーエンドの学習を実装する。
  • 標準ベンチマークを用いて、ドキュメント分類、情報抽出、ドキュメントリtrievalといった下流タスクで、事前学習モデルを微調整する。

実験結果

リサーチクエスチョン

  • RQ1マルチモーダルでマルチタスクの事前学習フレームワークは、ドキュメント内のテキスト、レイアウト、画像モダリティ間で共有表現を効果的に学習できるか?
  • RQ2ドキュメントトピックモデリング(DTM)やドキュメントシャッフル予測(DSP)といった新しい自己教師付き事前学習タスクは、従来の手法と比較してどのようにドキュメント表現学習を向上させるか?
  • RQ3分類、情報抽出、リtrievalのような多様な下流ドキュメントタスクへの汎用性はどの程度か?
  • RQ4推論時にテキスト情報が欠落した場合、画像およびレイアウト特徴の統合が性能に与える影響はいかほどか?
  • RQ5現実世界のドキュメント処理で一般的なマルチページドキュメントを効果的に処理できるか?

主な発見

  • 提案フレームワークは、複数の標準データセットでドキュメント分類、情報抽出、ドキュメントリtrievalタスクにおいて、最先端のモデルを上回る性能を達成した。
  • アブレーションスタディの結果、全フレームワーク(Our All)は画像特徴のみを用いた場合に約37%の性能低下を示したが、これはベースラインモデル(Our MC)の約43%の低下よりも顕著に低い値であり、画像表現学習の質の高さを示している。
  • ドキュメントシャッフル予測(DSP)およびドキュメントトピックモデリング(DTM)タスクの導入により、テキストが欠落した推論時における性能低下が低減され、より頑健な画像表現が得られていることが裏付けられた。
  • テキスト情報が欠落しても、フレームワークは強力な性能を維持しており、新しい事前学習タスクによって視覚的およびレイアウト特徴が効果的に活用されていることが示された。
  • Longformerバックボーンにより、マルチページドキュメントからの長文シーケンスの処理が効果的に行われ、全ページにわたるエンドツーエンド学習が可能になった。
  • MVLM、CLF、DSP、DTMタスクの組み合わせがマルチタスク設定で行われることで、アブレーションバージョンや既存のベースラインと比較して、より良い一般化性能と下流タスクの性能向上が達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。