Skip to main content
QUICK REVIEW

[論文レビュー] OCR ACCURACY IMPROVEMENT ON DOCUMENT IMAGES THROUGH A NOVEL PRE-PROCESSING APPROACH

A. El Harraj, Naoufal Raissouni|arXiv (Cornell University)|Sep 11, 2015
Handwritten Text Recognition Techniques被引用数 12
ひとこと要約

本論文は、デジタルカメラやモバイルデバイスで撮影された劣化したドキュメント画像のOCR精度を向上させる、新しい非パrametricで教師なしの前処理パイプラインを提案する。局所的な明るさ/コントラスト補正、最適化されたグレースケール変換、アンシャープマスキング、およびグローバルバイナリゼーションを段階的に適用することで、標準ベンチマーク上での文字検出およびOCR性能が顕著に向上する。

ABSTRACT

Digital camera and mobile document image acquisition are new trends arising in the world of Optical Character Recognition and text detection. In some cases, such process integrates many distortions and produces poorly scanned text or text-photo images and natural images, leading to an unreliable OCR digitization. In this paper, we present a novel nonparametric and unsupervised method to compensate for undesirable document image distortions aiming to optimally improve OCR accuracy. Our approach relies on a very efficient stack of document image enhancing techniques to recover deformation of the entire document image. First, we propose a local brightness and contrast adjustment method to effectively handle lighting variations and the irregular distribution of image illumination. Second, we use an optimized greyscale conversion algorithm to transform our document image to greyscale level. Third, we sharpen the useful information in the resulting greyscale image using Un-sharp Masking method. Finally, an optimal global binarization approach is used to prepare the final document image to OCR recognition. The proposed approach can significantly improve text detection rate and optical character recognition accuracy. To demonstrate the efficiency of our approach, an exhaustive experimentation on a standard dataset is presented

研究の動機と目的

  • モバイルデバイスで撮影されたドキュメント画像に生じる照明の変動や歪みによって引き起こされるOCRの不正確さを是正すること。
  • ラベル付きデータやモデルの学習を必要とせず、非パrametricで教師なしの前処理手法を開発すること。
  • 画像コントラスト、シャープネス、バイナリゼーションの系統的な強化を通じて、文字検出およびOCR精度を向上させること。
  • 実際の撮影条件下で標準データセットを用いて、本手法の有効性を示すこと。

提案手法

  • ドキュメント画像全体にわたる不均一な照度や照明の変動を是正するため、局所的な明るさおよびコントラスト補正技術を適用する。
  • 入力のカラー画像を高品質なグレースケール表現に変換する最適化されたグレースケール変換アルゴリズムを用いる。
  • グレースケール画像にアンシャープマスキングを適用し、エッジの詳細を強調し、テキスト特徴を鋭くする。
  • 強化されたグレースケール画像をOCR処理に適したバイナリフォーマットに変換するため、最適なグローバルバイナリゼーション手法を用いる。
  • 全前処理パイプラインを、画像強調処理のスタックとして段階的に適用する。
  • 本手法は完全に教師なしで非パrametricであり、外部パrameter や学習データを必要としない。

実験結果

リサーチクエスチョン

  • RQ1モバイルデバイスやデジタルカメラで撮影されたドキュメント画像では、照明や歪みの問題が頻発するが、どのようにしてOCR精度を向上させることができるか?
  • RQ2どの前処理技術の組み合わせが、OCRに適したドキュメント画像の強化において最も効果的か?
  • RQ3事前にソース画像の知識が得られない状況下でも、非パrametricで教師なしのアプローチが、既存の手法を上回る性能を発揮できるか?

主な発見

  • 提案された前処理パイプラインは、不均一な照度や低コントラストを示すドキュメント画像において、顕著に文字検出率を向上させる。
  • 局所的コントラスト補正、最適化されたグレースケール変換、アンシャープマスキング、およびグローバルバイナリゼーションの組み合わせにより、OCR精度に測定可能な向上が得られる。
  • 学習データやパrameterチューニングを一切必要とせず、多様な実世界のドキュメント画像に対して安定した性能を発揮する。
  • 標準データセットを用いた実験により、本手法が困難な撮影条件下でもOCRの信頼性を向上させることの有効性が確認された。
  • 教師なしで非パrametricな性質を有するため、さまざまなドキュメントタイプや撮影デバイスに広く適用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。