Skip to main content
QUICK REVIEW

[論文レビュー] Binary Document Image Super Resolution for Improved Readability and OCR Performance

Ram Krishna Pandey, K. Vignesh|arXiv (Cornell University)|Dec 6, 2018
Advanced Image Processing Techniques参考文献 33被引用数 22
ひとこと要約

本稿では、可読性およびOCR精度を向上させるために、低解像度のバイナリータミルドキュメント画像向けに深層学習ベースの単一画像スーパーレゾリューション(SISR)手法を提案する。畳み込みニューラルネットワークにサブピクセル畳み込みとPReLU活性化関数を組み合わせ、その後処理としてパワー則変換を適用することで、最良のモデルは入力画像比で146.5%の相対的改善を達成した。

ABSTRACT

There is a need for information retrieval from large collections of low-resolution (LR) binary document images, which can be found in digital libraries across the world, where the high-resolution (HR) counterpart is not available. This gives rise to the problem of binary document image super-resolution (BDISR). The objective of this paper is to address the interesting and challenging problem of super resolution of binary Tamil document images for improved readability and better optical character recognition (OCR). We propose multiple deep neural network architectures to address this problem and analyze their performance. The proposed models are all single image super-resolution techniques, which learn a generalized spatial correspondence between the LR and HR binary document images. We employ convolutional layers for feature extraction followed by transposed convolution and sub-pixel convolution layers for upscaling the features. Since the outputs of the neural networks are gray scale, we utilize the advantage of power law transformation as a post-processing technique to improve the character level pixel connectivity. The performance of our models is evaluated by comparing the OCR accuracies and the mean opinion scores given by human evaluators on LR images and the corresponding model-generated HR images.

研究の動機と目的

  • 高解像度の対応画像が入手不可能な低解像度(75 dpi)のバイナリータミルドキュメント画像において、可読性とOCRパフォーマンスを向上させる課題に対処すること。
  • 歴史的・文化的デジタル化プロジェクト(例:Project Madurai)を支援するため、バイナリドキュメント画像スーパーレゾリューション(BDISR)に特化した深層ニューラルネットワークアーキテクチャを開発すること。
  • ピクセル接続が疎でテキストが多めのバイナリドキュメント画像に最適化されていない既存のスーパーレゾリューション手法の限界を克服すること。
  • BDISRモデルの学習および評価を支援するため、ペアドの低解像度および高解像度タミル語ドキュメント画像パッチから構成される公開可能なデータセットを構築すること。
  • 後処理技術を用いて、スーパーレゾolvド画像におけるピクセル接続性と構造的忠実性を向上させることで、OCRパフォーマンスを向上させること。

提案手法

  • 特徴抽出のための畳み込み層と、スケーリングのための転置畳み込み層またはサブピクセル畳み込み層を用いた複数のSISRアーキテクチャを提案する。
  • 深層ネットワークにおける学習の安定化と勾配の流れの改善のため、残差接続を実装する。
  • 学習可能な負の勾配を許容するため、PReLU活性化関数を用いることで、ReLUよりも優れた特徴表現を実現する。
  • 最終出力のピクセル接続性向上とノイズ低減のため、後処理としてパワー則変換を適用する。
  • 低解像度および高解像度のタミル語ドキュメントパッチのカスタムデータセットを用いて、2×および4×のスケーリングを対象にモデルを学習する。
  • 転置畳み込み、サブピクセル畳み込み、および残差接続の各スレッドからの出力を比較・統合するため、3スレッド並列ネットワークアーキテクチャを採用する。

実験結果

リサーチクエスチョン

  • RQ1深層ニューラルネットワークは、タミル語のテキストを対象としたバイナリドキュメント画像の低解像度から高解像度へのマッピングを効果的に学習できるか?
  • RQ2転置畳み込みとサブピクセル畳み込みの異なるスケーリング層は、スーパーレゾルブド画像の品質およびOCRパフォーマンスにどのように影響するか?
  • RQ3バイナリドキュメントスーパーレゾリューションの文脈において、PReLU活性化関数はReLUに比べてどの程度パフォーマンスを向上させるか?
  • RQ4パワー則変換は、スーパーレゾルブドバイナリ画像におけるピクセル接続性およびOCR精度の向上にどの程度有効か?
  • RQ5カスタムタミル語ドキュメント画像データセットは、深層学習ベースのスーパーレゾリューションによってOCR精度を顕著に向上させることができるか?

主な発見

  • サブピクセル畳み込みとPReLU活性化関数を用いたCTS-PReLU-×4モデルは、元の低解像度入力画像比で146.5%の相対的OCR精度向上を達成した。
  • サブピクセル畳み込みベースのスレッドは、転置畳み込みおよび残差接続スレッドを上回り、特に微細なテキストディテールの保持において優れた性能を示した。
  • 4×スケーリングは2×スケーリングに比べて顕著にOCR精度が向上した。これは、文字構造と接続性の向上によるものである。
  • パワー則変換の後処理によりOCR精度がわずかに向上し、CTSγ-PReLU-×4モデルは入力画像比で107%の相対的改善を達成した。
  • 人間の評価者による評価では、CTSモデルの出力が最も高い知覚的品質を得ており、タミル語話者および非タミル語話者両方の評価者から4×スケーリング結果が好まれた。
  • 提案モデルはベースライン手法を著しく上回り、CTS-PReLU-×4設定では転置畳み込みモデルに比べて約10%、残差接続スレッドに比べて約8%高いOCR精度を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。