Skip to main content
QUICK REVIEW

[論文レビュー] Deep Neural Network for Semantic-based Text Recognition in Images

Yi Zheng, Qitong Wang|arXiv (Cornell University)|Aug 4, 2019
Handwritten Text Recognition Techniques参考文献 31被引用数 5
ひとこと要約

本論文では、テキストグループ化・配置(TGA)アルゴリズムを用いて分離されたテキスト領域をグループ化・順序付けし、双方向LSTMを備えたシーケンス・ツー・シーケンスモデルによる予測補正を通じて、画像内の文字認識を向上させる意味的ベースのテキスト認識(STR)モデルを提案する。STRモデルはスキャン済みのカタログ画像で90%、挑戦的な抗議看板画像で71%の精度を達成し、孤立した語認識を超えた文脈的理解を通じてより高い頑健性を示している。

ABSTRACT

State-of-the-art text spotting systems typically aim to detect isolated words or word-by-word text in images of natural scenes and ignore the semantic coherence within a region of text. However, when interpreted together, seemingly isolated words may be easier to recognize. On this basis, we propose a novel "semantic-based text recognition" (STR) deep learning model that reads text in images with the help of understanding context. STR consists of several modules. We introduce the Text Grouping and Arranging (TGA) algorithm to connect and order isolated text regions. A text-recognition network interprets isolated words. Benefiting from semantic information, a sequenceto-sequence network model efficiently corrects inaccurate and uncertain phrases produced earlier in the STR pipeline. We present experiments on two new distinct datasets that contain scanned catalog images of interior designs and photographs of protesters with hand-written signs, respectively. Our results show that our STR model outperforms a baseline method that uses state-of-the-art single-wordrecognition techniques on both datasets. STR yields a high accuracy rate of 90% on the catalog images and 71% on the more difficult protest images, suggesting its generality in recognizing text.

研究の動機と目的

  • 最先端のテキストスポットリングシステムが語を孤立して扱い、テキスト領域内の意味的整合性を無視するという限界に対処すること。
  • グループ化されたフレーズや文から得られる文脈的・意味的情報を活用することで、文字認識の正確性を向上させること。
  • テキスト領域を一貫したフレーズや段落にグループ化・順序付けする新しいレイアウト解析アルゴリズム(TGA)を開発すること。
  • 学習および評価のための複数語フレーズおよび段落の真値グループ化を備えた、2つの新しい公開データセットを構築すること。
  • 意味的文脈が多様で現実世界の画像ドメインにわたり、文字認識を改善する一般性と有効性を実証すること。

提案手法

  • TGAアルゴリズムは、空間的接近度、整列性、視覚的類似性を分析することで、分離されたテキスト領域を一貫したフレーズや段落にグループ化・順序付けする。
  • ディープラーニングベースの文字認識ネットワークが個々の語を処理し、初期予測を生成する。
  • 双方向LSTMを備えたシーケンス・ツー・シーケンスモデルは、予測された語列からの文脈的情報を符号化し、綴りや語の選択ミスを是正する。
  • シーケンス・ツー・シーケンスモデルは、予測された語列を入力とし、是正された語列を出力とすることで、文脈的綴り間違いの是正が可能になる。
  • 画像特徴に依存するのではなく、空間的グループ化と意味的文脈という多段階の情報を統合することで、認識精度を向上させる。
  • フレームワークは、2つの新しいデータセット(IDD:スキャン済みのインテリアカタログ、TPID:手書きテキストを含む抗議看板の写真)上で学習および評価された。

実験結果

リサーチクエスチョン

  • RQ1一貫したフレーズにグループ化・順序付けされた分離テキスト領域を用いることで、画像内の文字認識精度が向上するか?
  • RQ2双方向LSTMを備えたシーケンス・ツー・シーケンスモデルは、意味的文脈を活用して語認識の誤りをどの程度効果的に是正できるか?
  • RQ3意味的文脈を組み込むことで、幾何的歪み、不規則なフォント、水平でないテキストレイアウトを示す困難な現実世界の画像において、認識性能が顕著に向上するか?
  • RQ4印刷されたカタログと手書きの抗議看板といった異なる意味的文脈において、モデルの汎用性はどの程度達成できるか?
  • RQ5TGAのようなレイアウト解析アルゴリズムは、複雑なシーンにおいて同じフレーズや段落に属するテキスト領域を信頼性高く特定・順序付けできるか?

主な発見

  • STRモデルはスキャン済みのインテリアカタログデータセット(IDD)で90%の認識精度を達成し、ベースラインの単語認識手法を顕著に上回った。
  • より挑戦的な抗議画像データセット(TPID)では、STRは71%の精度を達成し、幾何的歪み、不規則なフォント、非水平なテキストレイアウトに対しても頑健であることが示された。
  • TGAアルゴリズムはIDD画像の90%でテキスト領域を正常にグループ化・配置できたが、重なったり回転しているテキスト領域では困難を示した。
  • シーケンス・ツー・シーケンス補正モデルは、誤認識された語(例:'SILLS' → 'SPILLS')や欠落した語(例:文における'a'の欠落)を効果的に是正し、文の流暢さと正確性を向上させた。
  • モデルは意味的文脈を活用することで誤り率を低減し、文脈的情報が孤立した語の分析をはるかに超えて認識を向上させることを実証した。
  • 真値フレーズおよび段落アノテーションを備えた、新たに提案されたデータセットIDDおよびTPIDは公開されており、意味的ベースの文字認識のための新基準としての役割を果たす。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。