Skip to main content
QUICK REVIEW

[論文レビュー] Generative Shape Models: Joint Text Recognition and Segmentation with Very Little Training Data

Xinghua Lou, Ken Kansky|arXiv (Cornell University)|Nov 8, 2016
Handwritten Text Recognition Techniques参考文献 18被引用数 6
ひとこと要約

本稿では、識別的モデルと比較して数百枚の訓練画像でさえも、顕著に少ないデータ量で最先端のシーンテキスト認識と微細な文字分離を達成する生成的形状モデルを紹介する。ラテラル制約による不変性の組み込みと、貪欲なフォント選択法を用いることで、アフィンおよび非アフィン変形に対しても頑健に一般化でき、最小限の教師信号にもかかわらず、ディープラーニングベースラインを上回る性能を発揮する。

ABSTRACT

We demonstrate that a generative model for object shapes can achieve state of the art results on challenging scene text recognition tasks, and with orders of magnitude fewer training images than required for competing discriminative methods. In addition to transcribing text from challenging images, our method performs fine-grained instance segmentation of characters. We show that our model is more robust to both affine transformations and non-affine deformations compared to previous approaches.

研究の動機と目的

  • フォント、変形、画像品質に著しいばらつきを示す実世界の画像におけるシーンテキスト認識の課題に対処すること。
  • 大量ラベル付きデータセットへの依存を減らすために、少数の訓練例から良好に一般化する生成的モデルを開発すること。
  • 明示的な検出ステップを経ずに、正確な文字分離と語の解析を同時に実行すること。
  • 明示的に組み込まれた形状不変性により、アフィンおよび非アフィン歪みに対する頑健性を向上させること。
  • データが限られる状況において、構造的事前知識を有する生成的モデリングが、ディープな識別的モデルを上回ることを示すこと。

提案手法

  • 短いおよび長いラテラル制約を用いて、グローバルな形状構造を学習するため、綺麗でごみのない文字画像上で生成的形状モデルを訓練する。
  • ラテラル制約は、指定された半径内での制御された摂動を許容することで、変形に対する不変性を符号化し、歪みに対する頑健性を向上させる。
  • 大規模なデータベースから代表的なフォントを貪欲なフォント選択アルゴリズムで抽出し、実際のシーンにおける強いフォント変動に対処する。
  • 構造的出力学習に基づく語解析器は、文字レベルの特徴(例:サイズ、位置、色、n-gram)および言語モデルを用いて語を再構築する。
  • 標準の識別的モデルが前方伝搬のみを行うのに対し、推論時にバックトラッキングを実行して分離境界を精緻化する。
  • 解析特徴には、形状事前知識、空間的距離、高さおよびyオフセットの差、色類似度、n-gram確率が含まれ、これらはすべて正規化され、対数変換されている。

実験結果

リサーチクエスチョン

  • RQ1生成的形状モデルは、識別的モデルと比較して著しく少ない訓練データで、シーンテキスト認識において最先端の性能を達成できるか?
  • RQ2ラテラル制約による明示的な不変性符号化は、アフィンおよび非アフィン変形の処理にどの程度効果的か?
  • RQ3生成的モデルが正確な分離境界を生成できる能力が、検出ベースのアプローチと比較して、解析性能にどの程度寄与するか?
  • RQ4言語モデルを無効化した場合、本システムの性能はCNNなどの識別的モデルと比較してどの程度の差を示すか?
  • RQ5階層的でない生成的モデルが、不変性をモデル構造に直接組み込むことで、ディープな階層的識別的モデルを凌駆できるか?

主な発見

  • 本モデルは、ICDAR 2013およびSVTデータセットで、識別的モデルが通常必要とする数百万枚のデータとは比べ物にならないほど少ない数百枚の訓練画像で、最先端の性能を達成した。
  • 言語モデルを無効化した場合、システムの性能は約15%低下したが、PhotoOCRと比較して40%の低下にとどまり、より優れた分離による頑健性が示された。
  • 明示的に符号化されたラテラル制約のおかげで、アフィン変換および非アフィン歪みの両方に対して優れた一般化性能を示した。
  • CNN や DPM などの識別的モデルとは異なり、本生成的モデルは追加の後処理なしに正確な分離境界を生成した。
  • PhotoOCR がしばしば失敗するクリアな画像においても、本システムは PhotoOCR を上回った。これは、正確な分離の利点を示している。
  • 構造的事前知識と不変性符号化を有する生成的アプローチは、データ量が少ない状況でディープな識別的モデルを上回った。これは、誘導的バイアスがデータ量を上回ることを実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。