Skip to main content
QUICK REVIEW

[論文レビュー] A Probabilistic Framework for Lexicon-based Keyword Spotting in Handwritten Text Images

Enrique Vidal, Alejandro H. Toselli|arXiv (Cornell University)|Apr 9, 2021
Handwritten Text Recognition Techniques参考文献 64被引用数 6
ひとこと要約

本稿では、手書き本文画像のための確率的でセグメンテーション不要、語彙ベースのキーワード検索(KWS)フレームワークを提案する。現代の手書き本文認識(HTR)で用いられる統計モデルを活用し、事前のトランスクリプションなしに画像領域内の語の尤度を直接推定する。この手法は、複数のベンチマークおよび大規模データセットで最先端の性能を達成し、従来の手法を著しく上回る。

ABSTRACT

Query by String Keyword Spotting (KWS) is here considered as a key technology for indexing large collections of handwritten text images to allow fast textual access to the contents of these collections. Under this perspective, a probabilistic framework for lexicon-based KWS in text images is presented. The presentation aims at providing a tutorial view that helps to understand the relations between classical statements of KWS and the relative challenges entailed by these statements. More specifically, the development of the proposed framework makes it self-evident that word recognition or classification implicitly or explicitly underlies any formulation of KWS. Moreover, it clearly suggests that the same statistical models and training methods successfully used for handwriting text recognition can advantageously be used also for KWS, even though KWS does not generally require or rely on any kind of previously produced image transcripts. These ideas are developed into a specific, probabilistically sound approach for segmentation-free, lexicon-based, query-by-string KWS. Experiments carried out using this approach are presented, which support the consistency and general interest of the proposed framework. Several datasets, traditionally used for KWS benchmarking are considered, with results significantly better than those previously published for these datasets. In addition, results on two new, larger handwritten text image datasets are reported, showing the great potential of the methods proposed in this paper for indexing and textual search in large collections of handwritten documents.

研究の動機と目的

  • 手動トランスクリプションが非現実的である大規模な手書き本文画像コレクションに対して、堅牢でスケーラブルなキーワード検索システムを開発すること。
  • 歴史的文書において誤りが生じやすい、単語レベルのセグメンテーションや完全トランスクリプションに依存する従来のKWS手法の限界を解消すること。
  • 語認識モデルが事前の画像トランスクリプションを必要とせず、直接KWSに適応可能であることを示すこと。
  • 画像-テキスト連合分布上の確率的推論を用いて、大規模な手書き文書コレクションにおける効率的で正確なテキスト検索を可能にすること。
  • フレームワークを標準ベンチマークおよび新しい大規模データセットで評価し、汎化性およびスケーラビリティを検証すること。

提案手法

  • フレームワークは、語グラフ表現を用いて、画像領域とその内容の連合確率分布をモデル化し、エンドツーエンドの確率的推論を可能にする。
  • 現代のセグメンテーション不要な手書き本文認識(HTR)で用いられる同じ統計モデルおよび学習手順(例:HMMやDNN)をKWSに活用する。
  • 照合スコアは、連合画像-テキストモデルを用いた後方確率として計算され、明示的なセグメンテーションや認識を回避する。
  • この手法は、ラインまたはブロックレベルで動作し、セグメンテーションの複雑さを低減するための検索ユニットとして扱う。
  • 事前に定義された語彙(学習データから抽出)に基づく語彙ベースのアプローチを採用する。
  • OOV語の場合は、類似語を用いたスムージング技術を検討しており、今後は完全な文字レベル(語彙フリー)インデクシングへの拡張を進めている。

実験結果

リサーチクエスチョン

  • RQ1HTRモデルに基づく統一された確率的フレームワークは、事前の画像トランスクリプションを必要とせず、キーワード検索に効果的に適用可能か?
  • RQ2標準的および大規模な手書き本文画像データセットにおいて、セグメンテーション不要で語彙ベースのKWSの性能は、既存手法と比べてどうか?
  • RQ3HTRで使用される同じ統計モデルを、最小限の変更でKWSに再利用可能か、その程度はいかほどか?
  • RQ4フレームワークは、語彙外(OOV)のクエリをどのように処理するか?また、応答時間と精度のトレードオフは何か?
  • RQ5数百万ページに及ぶ大規模コレクションに対しても、このフレームワークは効果的にスケーリング可能で、高い検索精度を維持できるか?

主な発見

  • 提案されたKWSフレームワークは、手書き本文画像キーワード検索の複数の標準ベンチマークデータセットで最先端の結果を達成した。
  • 2つの新しい大規模な手書き本文データセットにおいて、優れた汎化性とスケーラビリティを示し、以前に発表された結果を著しく上回った。
  • フレームワークの性能は、従来の語彙ベースおよび語彙フリーKWS手法と比較して一貫して優れており、特に精度と効率性の面で顕著であった。
  • 語グラフによる画像-テキスト連合確率モデリングの活用により、明示的な語セグメンテーションや完全トランスクリプションなしに、堅牢なキーワード検出が可能になった。
  • HIMANIS検索システムへの統合を通じて、実世界への展開の可能性が裏付けられ、75,000ページに及ぶ大規模インデクシングとライブクエリをサポートしている。
  • 同じ確率的フレームワーク内での文字レベルモデリングを用いた語彙フリーKWSの予備的検討は、性能を落とさずにOOVクエリを処理する可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。