Skip to main content
QUICK REVIEW

[論文レビュー] One-shot Information Extraction from Document Images using Neuro-Deductive Program Synthesis

Vishal Sunder, Ashwin Srinivasan|arXiv (Cornell University)|Jun 6, 2019
Handwritten Text Recognition Techniques参考文献 27被引用数 7
ひとこと要約

本稿では、事前学習済みの深層ニューラルネットワークと神経的帰納的プログラミング合成を組み合わせることで、1枚のラベル付き画像から一括で情報抽出を可能にする神経的記号的フレームワークを提案する。1枚のラベル付き画像と論理的推論のためのメタインタプリタを用いることで、類似した文書に一般化しやすい再利用可能な論理プログラムを合成し、最小限の教師データで高い精度を達成するとともに、外れ値のケースに対する人間によるフィードバックを可能にする。

ABSTRACT

Our interest in this paper is in meeting a rapidly growing industrial demand for information extraction from images of documents such as invoices, bills, receipts etc. In practice users are able to provide a very small number of example images labeled with the information that needs to be extracted. We adopt a novel two-level neuro-deductive, approach where (a) we use pre-trained deep neural networks to populate a relational database with facts about each document-image; and (b) we use a form of deductive reasoning, related to meta-interpretive learning of transition systems to learn extraction programs: Given task-specific transitions defined using the entities and relations identified by the neural detectors and a small number of instances (usually 1, sometimes 2) of images and the desired outputs, a resource-bounded meta-interpreter constructs proofs for the instance(s) via logical deduction; a set of logic programs that extract each desired entity is easily synthesized from such proofs. In most cases a single training example together with a noisy-clone of itself suffices to learn a program-set that generalizes well on test documents, at which time the value of each entity is determined by a majority vote across its program-set. We demonstrate our two-level neuro-deductive approach on publicly available datasets ("Patent" and "Doctor's Bills") and also describe its use in a real-life industrial problem.

研究の動機と目的

  • 最小限のラベル付き学習データで文書画像から構造化された情報を抽出するという産業的課題に対処すること。
  • 1〜数例の例示から一般化可能なデータ効率の良い情報抽出手法を開発すること。
  • 解釈可能な論理プログラムを活用することで、人間によるフィードバックを組み込んだアウylaアノテーションによる外れ値ケースの修正を可能にすること。
  • 深層学習ベースのビジョンと記号的推論を統合し、文書理解における耐障害性と解釈可能性を向上させること。
  • 公開データセットおよび実際の産業応用においてフレームワークを実証的に検証すること。

提案手法

  • 文書画像からエンティティおよび空間的関係を検出・抽出するため、事前学習済みの深層ニューラルネットワーク(VisionAPI)を用い、リレーショナルデータベースを構築する。
  • 視覚的および文脈的ヒントから得られるエンティティカテゴリと、基本的な関係(例:'above'、'below')を用いて文書構造を表現する。
  • メタルールと検出済みの事実を用いて、タスク固有の抽出のための証明を構築するために、リソース制限付きのメタインタプリタを適用する。
  • メタ的解釈学習により、これらの証明から再利用可能な論理プログラムを合成し、同種の未観測文書への一般化を可能にする。
  • 複数のプログラムを含むプログラム集合における多数決投票により、各抽出エンティティの最終的な値を決定する。
  • 人間によるフィードバックメカニズムを導入し、外れ値のケースに対応する追加のアノテーション(1〜2例)を用いてプログラムを改善することで、耐障害性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1神経的記号的システムは、1つのラベル付き例のみを用いて、文書画像からの効果的な1ショット情報抽出を達成できるか?
  • RQ2メタ的解釈学習により合成された論理プログラムは、同種の未観測文書にどの程度一般化できるか?
  • RQ3人間によるフィードバックによる修正は、外れ値の変種に対してどの程度性能を向上させるか?
  • RQ4深層学習と記号的推論の統合は、文書理解におけるデータ効率性と解釈可能性をどの程度向上させるか?
  • RQ5提案されたフレームワークは、公開ベンチマークをはるかに超えた実世界の産業的文書タイプに対しても、実用的に適用可能か?

主な発見

  • 本システムは、1つのラベル付き例を1文書タイプあたりに用いるだけで、公開データセット(特許および医師の領収書)で高い一般化性能を達成した。
  • 多くの場合、1つのトレーニング例に加えてノイズの混入したクローン例があれば、テスト文書においても良好に一般化するプログラム集合を学習可能であった。
  • 複数の合成プログラムにおける多数決投票の活用により、エンティティ抽出の耐障害性と精度が向上した。
  • 1〜2例の追加例による人間によるフィードバックにより、外れ値のケースでほぼ完璧な性能が達成された。
  • 本手法は、データ収集コストが高いために特に有効な産業的展開において、強いデータ効率性とスケーラビリティを示した。
  • 本フレームワークは、エンジニアリング図面を含む他の文書タイプへも拡張可能であり、広範な適用可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。