Skip to main content
QUICK REVIEW

[論文レビュー] Corpus Conversion Service: A Machine Learning Platform to Ingest Documents at Scale

Peter Staar, Michele Dolfi|arXiv (Cornell University)|May 24, 2018
Web Data Mining and Analysis参考文献 11被引用数 17
ひとこと要約

本論文では、PDFおよびビットマップ形式の文書をスケーラブルに処理し、JSONなどの構造化データ形式に変換する、スケーラブルでクラウドベースの機械学習プラットフォーム「コロラス変換サービス(CCS)」を提示する。非同期マイクロサービスアーキテクチャとトレーニング済みのディープラーニングモデルを活用することで、CCSはコンテンツ抽出においてほぼ完璧な正確性と再現率(最大99%)を達成し、グランドトゥルースのアノテーションを最低でも1桁以上高速化する。

ABSTRACT

Over the past few decades, the amount of scientific articles and technical literature has increased exponentially in size. Consequently, there is a great need for systems that can ingest these documents at scale and make the contained knowledge discoverable. Unfortunately, both the format of these documents (e.g. the PDF format or bitmap images) as well as the presentation of the data (e.g. complex tables) make the extraction of qualitative and quantitive data extremely challenging. In this paper, we present a modular, cloud-based platform to ingest documents at scale. This platform, called the Corpus Conversion Service (CCS), implements a pipeline which allows users to parse and annotate documents (i.e. collect ground-truth), train machine-learning classification algorithms and ultimately convert any type of PDF or bitmap-documents to a structured content representation format. We will show that each of the modules is scalable due to an asynchronous microservice architecture and can therefore handle massive amounts of documents. Furthermore, we will show that our capability to gather ground-truth is accelerated by machine-learning algorithms by at least one order of magnitude. This allows us to both gather large amounts of ground-truth in very little time and obtain very good precision/recall metrics in the range of 99\% with regard to content conversion to structured output. The CCS platform is currently deployed on IBM internal infrastructure and serving more than 250 active users for knowledge-engineering project engagements.

研究の動機と目的

  • 膨大な量の科学的・技術的PDFおよびビットマップ形式文書から構造化された知識を抽出するという、増加する課題に対処すること。
  • 未構造化な文書コンテンツを、JSON や XML などの構造化フォーマットにスケーラブルかつ高精度に変換し、知識発見を可能にすること。
  • 文書解析タスクにおける機械学習モデルのトレーニングに必要なグランドトゥルースデータ収集を加速すること。
  • 同時に複数のユーザーをサポートし、大規模な文書ワークロードと動的リソーススケーリングを可能にするモジュラーでクラウドネイティブなプラットフォームを設計すること。
  • マイクロサービスとディープラーニングを活用して、文書変換パイプラインの効率性とパフォーマンスを向上させること。

提案手法

  • プラットフォームは、文書解析、レイアウトの意味的アノテーション、グランドトゥルースに基づくモデルトレーニング、トレーニング済みモデルを用いた推論、構造化出力のアセンブリ(例:JSON)の5段階パイプラインを採用している。
  • 各パイプラインコンponentは、非同期メッセージキーや通信を介して独立してスケーリング可能で、障害耐性を持つステートレスなマイクロサービスとして実装されている。
  • グランドトゥルースのアノテーションは機械学習を活用して加速され、人的作業を最低でも1桁以上削減している。
  • ディープラーニングモデルは、アノテートされたデータを用いてトレーニングされ、レイアウト要素(例:表のセル、テキストブロック)の分類や、解析済み文書内の意味的役割の予測が行われる。
  • Kubernetes上でデプロイされており、動的リソースバインディングにより、各マイクロサービスごとに柔軟にコンピューティングリソースをスケーリング可能である。
  • オプションのOCRおよび画像処理マイクロサービスを介して、ネイティブPDFおよびスキャン済み文書の両方をサポートしている。

実験結果

リサーチクエスチョン

  • RQ1未構造化なPDFおよびビットマップ形式文書を大規模に構造化データに変換するための、スケーラブルでモジュラーなプラットフォームをどのように設計できるか?
  • RQ2機械学習を活用することで、文書レイアウト理解のためのグランドトゥルースデータ収集は、どの程度高速化できるか?
  • RQ3プラットフォームのマイクロサービスアーキテクチャは、ユーザー数、文書量、コンピューティングリソースのスケーリングにおいて、水平スケーリングをどのように実現するか?
  • RQ4トレーニング済みのディープラーニングモデルを用いた文書レイアウトの構造化コンテンツ抽出において、どの程度の正確性と再現率が達成できるか?
  • RQ5さまざまなワークロードや文書サイズの下で、システムはどのようにして解法までの時間を一定に保っているか?

主な発見

  • コロラス変換サービスプラットフォームは、250人を超える同時アクティブユーザーを処理でき、大量のPDFページを処理する際も、急激な利用増加時でさえパフォーマンスが安定している。
  • 構造化されたコンテンツ変換において、正確性と再現率が最大99%に達しており、文書レイアウト理解の高精度性が裏付けられている。
  • 機械学習を活用することで、グランドトゥルースのアノテーションが最低でも1桁以上高速化され、人的ラベル付けの時間が大幅に削減された。
  • 解析および機械学習推論コンponentは、ワーカーノード数に応じて線形(およびわずかに線形より良い)にスケーリングされ、強力な水平スケーリング性が示された。
  • ページ単位の並列処理に内在する制限のため、文書アセンブリフェーズではスループット曲線がやや平坦になったが、大規模なコロラスサイズでは負荷の不均衡が緩和された。
  • ワークロードの需要に応じて動的にコンピューティングリソースを割り当てることで、システムは解法までの時間を一定に保ち、予測可能なパフォーマンスを維持している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。