Skip to main content
QUICK REVIEW

[論文レビュー] CITlab ARGUS for historical handwritten documents

Gundram Leifert, Tobias Strauß|arXiv (Cornell University)|May 26, 2016
Handwritten Text Recognition Techniques参考文献 3被引用数 19
ひとこと要約

本稿では、tranScriptoriumデータセットからの歴史的手書き文書を認識するための、多次元再帰ニューラルネットワーク(MDRNN)および接続主義的時系列分類(CTC)に基づくCITlab ARGUSというシステムを提示する。このシステムは、ニューラルネットワークの信頼度行列と複数のデコーディング戦略(語彙モデルおよびアンサンブル手法を含む)を組み合わせたハイブリッドアプローチを採用しており、堅牢な前処理と高度なデコーディング方式のおかげで、HTRtS 2015コンテストで最先端の性能を達成した。

ABSTRACT

We describe CITlab's recognition system for the HTRtS competition attached to the 13. International Conference on Document Analysis and Recognition, ICDAR 2015. The task comprises the recognition of historical handwritten documents. The core algorithms of our system are based on multi-dimensional recurrent neural networks (MDRNN) and connectionist temporal classification (CTC). The software modules behind that as well as the basic utility technologies are essentially powered by PLANET's ARGUS framework for intelligent text recognition and image processing.

研究の動機と目的

  • スクリプトの変動性と劣化が著しい歴史的文書に特化した、頑健な手書き文字認識システムの開発。
  • 不規則な行間隔、傾き、インクの質のばらつきがある歴史的手書き文書の文字認識の課題に対処すること。
  • ニューラルネットワークモデリングと知的デコーディング戦略の組み合わせにより、認識精度の向上を図ること。
  • スケーラブルでモジュラーなテキスト認識パイプラインの開発のため、PLANET ARGUSフレームワークを活用すること。
  • 最適な転写パフォーマンスを得るために、語彙モデルやアンサンブル手法を含む複数のデコーディング方式を評価・比較すること。

提案手法

  • 標準的な前処理(コントラスト正規化、サイズ調整、書体正規化)を経たラインポリゴン画像を処理し、ライン高を96pxに標準化する。
  • 全ライン画像をセグメンテーションなしで処理するシーケンス処理再帰ニューラルネットワーク(SPRNN)が、各画像位置における文字確率を推定する信頼度行列を出力する。
  • 信頼度行列は複数のデコーディング方式で解釈される:最良経路(Dec-BP)、CITlab式式表現デコーディング(Dec-CE)、語彙モデルデコーディング(Dec-DM)、nエキスパート委員会(Dec-E<n>、n=2〜5)。
  • Dec-DM方式は、学習データからの語彙頻度データを組み込み、より確率の高い語の並びを優先することで、認識精度を向上させる。
  • Dec-E<n>方式は、検証性能で上位n個のSPRNNの出力を組み合わせ、コンSENSUSアルゴリズムを用いて耐障害性を向上させる。
  • 学習には2つの方式を用いた:trn-1(最初のバッチで10,491行)とtrn-2(追加のページから抽出された3,968行を追加し、合計14,479行に拡張)。ハイパーパrameterは勾配降下法と検証セットにおける早期停止を用いて調整された。

実験結果

リサーチクエスチョン

  • RQ1複雑なスクリプトのばらつきを示す歴史的手書き文書の認識に、CTC学習を用いた多次元再帰ニューラルネットワークがどの程度有効であるか。
  • RQ2式に基づくルール、語彙モデル、アンサンブル手法を含む、異なるデコーディング戦略が、歴史的テキストの認識精度にどの程度寄与するか。
  • RQ3ラインの傾き、傾き、コントラストを正規化する統合された前処理パイプラインは、多様な歴史的文書全体にわたり認識性能を顕著に向上させるか。
  • RQ4デコーディングに語の頻度情報を組み込むことで、信頼度のみに依存するデコーディングと比較して、転写品質はどの程度向上するか。
  • RQ5複数のニューラルネットワークのアンサンブルを用いることで、個々のモデルに比べてどの程度のパフォーマンス向上が達成できるか。

主な発見

  • MDRNNと高度なデコーディング戦略の組み合わせにより、HTRtS 2015コンテストで最良のパフォーマンスを達成した。
  • Dec-DM(語彙モデル)およびDec-E<n>(nエキスパート委員会)デコーディング方式は、Dec-BP や Dec-CE といった単純な手法を顕著に上回った。
  • 追加で抽出されたラインポリゴンを含むtrn-2データの使用により、trn-1のみに比べてモデルの一般化性能が向上した。
  • n=5のエキスパート委員会アプローチが最も優れた結果をもたらし、歴史的手書き文字認識における不確実性の処理におけるアンサンブルの価値を示した。
  • Dec-DMにおける語の頻度情報の組み込みにより、希少語や曖昧語に対してもより現実的で正確な転写が可能になった。
  • SPRNNに基づく信頼度行列に加え、NaC(非文字記号)検出を組み合わせることで、曖昧または不確実な文字予測に対しても効果的に対処できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。