Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Extract Semantic Structure from Documents Using Multimodal Fully Convolutional Neural Network

Xiao Yang, Ersin Yumer|arXiv (Cornell University)|Jun 7, 2017
Handwritten Text Recognition Techniques被引用数 58
ひとこと要約

この論文は、視覚特徴とテキスト埋め込みを同時に用いて、文書画像からピクセル単位の意味構造を抽出するマルチモーダル完全畳み込みネットワーク(MFCN)を提案し、合成データの事前学習と自己教師あり学習タスクで支援します。

ABSTRACT

We present an end-to-end, multimodal, fully convolutional network for extracting semantic structures from document images. We consider document semantic structure extraction as a pixel-wise segmentation task, and propose a unified model that classifies pixels based not only on their visual appearance, as in the traditional page segmentation task, but also on the content of underlying text. Moreover, we propose an efficient synthetic document generation process that we use to generate pretraining data for our network. Once the network is trained on a large set of synthetic documents, we fine-tune the network on unlabeled real documents using a semi-supervised approach. We systematically study the optimum network architecture and show that both our multimodal approach and the synthetic data pretraining significantly boost the performance.

研究の動機と目的

  • ピクセルレベルで appearance-based(レイアウト)と semantics-based(文書の役割)クラスを同時に識別するエンドツーエンドモデルを開発する。
  • 小さな領域や意味的に特徴的な領域のセグメンテーションを向上させるために、テキスト埋め込みマップを導入してテキスト情報を組み込む。
  • 合成データを用いて監視を拡張し、表現学習を強化するための自己教師付き補助タスクを提案する。
  • synthetic labeled data と unlabeled real documents を交互に用いて半教師ありトレーニングを可能にする。

提案手法

  • エンコーダ、セグメンテーションデコーダ、補助的再構成デコーダ(訓練時のみ)と視覚表現とテキスト表現を統合するブリッジを備えたマルチモーダル完全畳み込みネットワークを提案する。
  • 単語埋め込みを平均化して文レベルのベクトルを作成し、それを対応する文領域に割り当て、視覚特徴と連結してテキスト埋め込みマップを構成する。
  • 小さなオブジェクトの受容野を拡張するダイレーション畳み込みブロックを導入し、アンプーリングベースのスキップ接続によって空間的な正確性を保つ。
  • テキスト埋め込みを Wikipedia 上の skip-gram モデルで訓練して 128 次元の単語ベクトルを得て埋め込みマップを構築する。
  • 訓練中には二つの自己教師付き損失を使用する: 再構成損失(補助デコーダによる)と一貫性損失(境界ボックスを用いて区域内特徴の類似性を強制)。
  • 大規模な合成文書ジェネレータ(135,000 ページ)を開発し、 supervised pretraining のためのピクセル単位のグラウンドトゥルースを提供し、次に real documents で semi-supervised にファインチューニングする。

実験結果

リサーチクエスチョン

  • RQ1統合マルチモーダルネットワークは、基礎となるテキスト内容を活用することで、文書の segmentation において appearance のみを用いるアプローチを上回ることができるか?
  • RQ2テキスト埋め込みマップの導入は文書のピクセル単位意味的セグメンテーションにどのような影響を与えるか?
  • RQ3自己教師付き補助タスク(再構成と一貫性)は実データ上の表現学習とセグメンテーション精度を改善するか?
  • RQ4synthetic data pretraining は実データ上の高性能な文書意味構造抽出を実現するうえでどの程度効果的か?

主な発見

  • MFCN と multimodal 融合は DSSE-200, ICDAR2015, SectLabel データセットにおける appearance ベースのベースラインよりセグメンテーション性能を有意に向上させた。
  • テキスト埋め込みマップの組み込みは、セクション見出し、キャプション、リスト、段落などの意味クラスの精度を向上させる。
  • 自己教師付きタスクは利得をもたらし、再構成損失と組み合わせたとき一貫性損失が顕著な改善に寄与する。
  • 埋め込みマップで実際のテキスト(ground-truth text)を用いると、OCR 抽出テキストやテキスト情報なしと比べて大幅な性能向上をもたらし、正確なテキスト文脈の価値を示す。
  • ICDAR2015 では、非テキスト 94.5、テキスト 91.0、図 77.1 の IoU を binary variant で達成し、これらカテゴリで以前の方法を上回る。
  • SectLabel では、セクション見出し 0.919、キャプション 0.893、リスト 0.793 の F1 スコアを達成し、図表を識別する能力も示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。