[論文レビュー] Improving OCR Accuracy on Early Printed Books using Deep Convolutional Networks
本稿では、より深いアーキテクチャと増加したトレーニングデータを活用することで、初期印刷書籍におけるOCR精度を著しく向上させるCNN-LSTMハイブリッドモデルと投票機構を提案する。これにより、文字誤り率(CER)を0.5%未満にまで低下させた。この手法は、標準的なLSTMベースのOCRよりも最大44%の誤り率低減を達成しながら、同等の推論速度を維持した。
This paper proposes a combination of a convolutional and a LSTM network to improve the accuracy of OCR on early printed books. While the standard model of line based OCR uses a single LSTM layer, we utilize a CNN- and Pooling-Layer combination in advance of an LSTM layer. Due to the higher amount of trainable parameters the performance of the network relies on a high amount of training examples to unleash its power. Hereby, the error is reduced by a factor of up to 44%, yielding a CER of 1% and below. To further improve the results we use a voting mechanism to achieve character error rates (CER) below $0.5%$. The runtime of the deep model for training and prediction of a book behaves very similar to a shallow network.
研究の動機と目的
- 初期印刷書籍に見られるフォントや綴りの多様性に起因する、文字誤り率(CER)の低減。
- 1冊あたりの手動ラベル付けが多数必要となる標準的なLSTMベースのOCRモデルの限界を克服すること。
- 十分なトレーニングデータが利用可能な場合に、より多くの可学習パラメータを持つ深層アーキテクチャを用いて性能を向上させること。
- データ量と投票機構が歴史的文書OCRにおけるCER低減に与える影響を評価すること。
- GPUアクセラレーションとマルチスレーディングを活用して、効率的なトレーニングと推論を実現すること。
提案手法
- 畳み込み層とプーリング層が、ライン画像からの空間的および順序的特徴を抽出する双方向LSTM層に続く、CNN-LSTMハイブリッドアーキテクチャを採用する。
- 入力画像と転写テキストシーケンスのアラインメントを実現するため、接続主義的時系列分類(CTC)損失関数を用いてモデルをトレーニングする。
- 予測の堅牢性と多様性を高めるために、5つの独立したモデルをクロスフォールドトレーニング法で学習する。
- ISRIアナリティクスツールに基づく投票機構を採用し、最長共通部分列によるアラインメント後に、各モデル間で最も頻出する文字を選択する。
- GPUアクセラレーションによるトレーニングと推論を可能にするために、TensorFlowを実装基盤として採用する。これによりスループットとスケーラビリティが向上する。
- バッチ処理とマルチスレーディングを用いてトレーニングと予測を最適化し、異なるスレッド数でのパフォーマンスを評価する。
実験結果
リサーチクエスチョン
- RQ1CNN-LSTMハイブリッドモデルは、標準的なLSTMベースのOCRシステムに比べ、初期印刷書籍におけるCER低減をより効果的に実現できるか?
- RQ2ラベル付きトレーニングデータの増加が、歴史的テキストにおける深層OCRモデルの性能に与える影響は何か?
- RQ3複数のトレーニング済みネットワークからの多様な予測に投票機構を適用した場合、OCR精度はどの程度向上するか?
- RQ4十分なトレーニングデータが得られる状況下で、より多くのパラメータを持つ深層アーキテクチャを用いることで、高い性能が得られるか、たとえ複雑さが増しても?
- RQ5トレーニングおよび推論の効率性という観点から、深層モデルの実行時間は標準的なOCRシステムと比べてどうか?
主な発見
- 提案されたCNN-LSTMモデルは、標準的なLSTMベースのOCRに比べ、CERを最大44%まで低減し、テストされた3冊の初期印刷書籍すべてでCERが1%またはそれ以下にまで低下した。
- 投票機構を追加することで、CERはさらに低下し、すべての書籍で0.5%未満にまで下がった。特に3000行のトレーニングデータを使用したBook 1488では、CERが最小0.37%まで低下した。
- 推論速度は標準的なOCRopusと同等であり、ネイティブC++での効率的なCTCデコードにより、1行あたりの処理時間が半分にまで短縮された。
- 畳み込み演算の並列化により、最大4CPUスレッドを用いた場合、トレーニング時間が約40%短縮された。
- トレーニングデータの増加に伴い、モデルの性能が顕著に向上し、投票後におけるCERは1000行(1.0%)から2000行(0.66%)へ低下し、さらに3000行で0.37%まで低下した。
- 深層モデルの性能はスケーラブルで効率的であり、予測時間にほとんどオーバーヘッドがなく、GPUベースのバッチトレーニングによる顕著な性能向上が得られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。