[論文レビュー] Language Independent Single Document Image Super-Resolution using CNN for improved recognition
本稿では、文書画像の低解像度スキャンの品質向上を目的とした、言語および解像度に依存しない単一画像スーパーサンプリング手法を提案する。5層の畳み込みニューラルネットワーク(CNN)を用い、パラメトリックReLU活性化関数と1×1畳み込みを用いて低解像度パッチから高解像度パッチへのマッピングを学習することで、75 dpiのタミル語画像において最大4 dBのPSNR向上を達成し、文字認識(OCR)の精度を3%向上させた。
Recognition of document images have important applications in restoring old and classical texts. The problem involves quality improvement before passing it to a properly trained OCR to get accurate recognition of the text. The image enhancement and quality improvement constitute important steps as subsequent recognition depends upon the quality of the input image. There are scenarios when high resolution images are not available and our experiments show that the OCR accuracy reduces significantly with decrease in the spatial resolution of document images. Thus the only option is to improve the resolution of such document images. The goal is to construct a high resolution image, given a single low resolution binary image, which constitutes the problem of single image super-resolution. Most of the previous work in super-resolution deal with natural images which have more information-content than the document images. Here, we use Convolution Neural Network to learn the mapping between low and the corresponding high resolution images. We experiment with different number of layers, parameter settings and non-linear functions to build a fast end-to-end framework for document image super-resolution. Our proposed model shows a very good PSNR improvement of about 4 dB on 75 dpi Tamil images, resulting in a 3 % improvement of word level accuracy by the OCR. It takes less time than the recent sparse based natural image super-resolution technique, making it useful for real-time document recognition applications.
研究の動機と目的
- 高解像度の対応画像が入手できない状況においても、低解像度の文書画像がOCR性能を著しく低下させることの課題に対処すること。
- 高周波数成分が少ない文書画像に特化した、高速でエンドツーエンドのディープラーニングフレームワークを構築し、単一画像スーパーサンプリングを実現すること。
- 多言語(タミル語、カンナダ語、英語)および多様な解像度(50–300 DPI)の文書画像を用いた学習により、言語および解像度に依存しない性能を達成すること。
- スーパーサンプリングによる画像品質向上により、従来の補間法やスパースコーディング手法を上回るOCR精度を実現すること。
- 実時間でのドキュメント認識パイプラインへの導入に適した、軽量なCNNアーキテクチャを設計し、推論時間を短縮すること。
提案手法
- 最初の隠れ層の後に1×1畳み込みフィルタを用いた5層のCNNを学習し、非線形性を強化するとともに特徴量の次元を低減する。
- パラメトリックReLU(PReLU)とReLU活性化関数を用い、適応的非線形性を学習することで、特徴表現の質とモデル性能を向上させる。
- 135枚の文書画像から、3言語(タミル語、カンナダ語、英語)および3解像度(100–300 DPI)を用いて、合計510万組のHR-LRパッチペア(10×10 HR、16×16 LR)からなる学習データセットを構築した。
- 入力パッチのトレーニングを安定化させるために、グローバル平均を差し引き、[0,1]にレンジ正規化する空間正規化を適用した。
- 平均二乗誤差(MSE)損失関数と確率的勾配降下法(SGD)を用い、学習率0.0001、50エポック、バッチサイズ32でモデルを最適化した。
- 比較のためのベースラインとしてバイキューブ補間を用い、別々のテストセットを用いてPSNRおよびOCRの単語・文字認識精度で性能を評価した。
実験結果
リサーチクエスチョン
- RQ1言語固有の微調整なしに、1つのCNNベースのスーパーサンプリングモデルがタミル語、カンナダ語、英語の複数言語に一般化可能か?
- RQ2提案されたCNNは、低解像度の文書画像において、バイキューブ補間やスパースコーディング手法と比較して、PSNRおよびOCR精度をどの程度向上させるか?
- RQ31×1畳み込みとPReLU活性化関数の使用が、文書画像スーパーサンプリングにおける性能とモデル効率に与える影響は?
- RQ450–300 DPIの異なる入力解像度においても、モデルの性能が一貫しているか。これは解像度に依存しない性能を示唆するか?
- RQ5提案手法は、スキャン済み文書処理のOCRパイプラインに実装可能なリアルタイム性能を達成できるか?
主な発見
- 提案されたCNNモデルは、150 DPI入力ではバイキューブ補間に対して最大7.8 dBのPSNR向上を達成し、75 DPIのタミル語画像では4 dBの向上を示した。
- 75 dpiのタミル語画像では、OCRの単語認識精度がバイキューブ補間の59.6%から62.9%に上昇し、3.3ポイントの改善を達成した。
- PReLU活性化関数を用いたモデルはReLUを上回り、150 DPIのタミル語画像で28.48 dBのPSNRを達成したのに対し、ReLUでは28.29 dBであった。
- モデルは言語および解像度の両方で一般化可能であり、50–300 DPIの範囲で英語、タミル語、カンナダ語の文書において一貫したPSNR向上を示した。
- 最近のスパースベースのスーパーサンプリング手法と比較して、推論時間が顕著に短く、ドキュメント認識システムにおけるリアルタイム応用が可能である。
- 最初の隠れ層の直後に3層にわたり1×1畳み込みを適用することで、標準的な3層アーキテクチャに比べて性能が向上し、非線形性の強化と次元削減が図られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。