Skip to main content
QUICK REVIEW

[論文レビュー] Document Rectification and Illumination Correction using a Patch-based CNN

Xiaoyu Li, Bo Zhang|arXiv (Cornell University)|Sep 20, 2019
Advanced Vision and Imaging参考文献 35被引用数 8
ひとこと要約

本稿では、重複する画像パッチ上で局所的な歪みフロー推定を実行し、勾配ドメイン統合と二次的な照明補正ネットワークを用いる、パッチベースのCNN手法を提案する。この手法は、1,000枚の合成学習画像のみを用いても、複雑な歪みに対して従来手法よりも優れたOCR精度と視覚的品質を達成する。

ABSTRACT

We propose a novel learning method to rectify document images with various distortion types from a single input image. As opposed to previous learning-based methods, our approach seeks to first learn the distortion flow on input image patches rather than the entire image. We then present a robust technique to stitch the patch results into the rectified document by processing in the gradient domain. Furthermore, we propose a second network to correct the uneven illumination, further improving the readability and OCR accuracy. Due to the less complex distortion present on the smaller image patches, our patch-based approach followed by stitching and illumination correction can significantly improve the overall accuracy in both the synthetic and real datasets.

研究の動機と目的

  • 視覚的歪み(透視的歪みや折り目、カールなどの物理的変形)によって生じる単一ビュー文書画像の幾何的歪みを是正すること。
  • 補正済み文書における不均一な照明やサンプリングアーチファクトを是正することで、OCR精度を向上させること。
  • 特殊なハードウェアや複数のビューを必要とせず、多様な文書タイプに一般化できる深層学習手法を開発すること。
  • 複雑な照明、テクスチャ、変形を捉えた現実的な合成データセットを構築すること。
  • 学習ベースおよび非学習ベースの既存手法を上回る、補正精度と現実世界の歪みに対するロバストネスを達成すること。

提案手法

  • 入力文書画像を重複率25%のパッチに分割することで、局所的歪み学習を単純化する。
  • 各パッチに対して局所的な2次元変位ベクトル場(歪みフロー)を予測するCNNを訓練し、局所的な幾何的補正を可能にする。
  • パッチの結果を勾配ドメイン統合技術を用いて統合することで、シームの低減とパッチ境界における一貫性の維持を実現する。
  • 統合画像における非均一な照明やサンプリングアーチファクトを補正するための2番目のCNNを訓練し、色の忠実性を保持する。
  • 学習データセットは、3次元表面モデリング、リアルなテクスチャ処理、動的照明、露出シミュレーションを用いて合成される。これにより一般化性能が向上する。
  • 局所的フローパターン予測とグローバルな統合、照明補正を組み合わせることで、高品質なOCR対応文書画像を実現する。

実験結果

リサーチクエスチョン

  • RQ1複雑で空間的に変化する歪みに対して、パッチベースのCNN手法がグローバルフロー学習を上回る性能を発揮できるか?
  • RQ2パッチレベルの補正結果を勾配ドメイン統合することで、直接的なグローバルワープに比べて一貫性が高く、視覚的に自然な文書画像が得られるか?
  • RQ3専用の照明補正ネットワークは、標準的な二値化手法を上回るOCR精度を著しく向上させられるか?
  • RQ4本手法は、学習データに含まれない未観測の文書タイプ(例:ポスター、楽譜)に対しても一般化できるか?
  • RQ51,000枚の小さな合成データセットが、大規模な実世界データセット(例:10万枚)と同等の性能を達成できるか、その程度はどの程度か?

主な発見

  • 提案手法は、合成および実世界データセットの両方において、Maら(2018年)を含む最先端手法を上回り、OCR精度と知覚的品質の両面で優れた結果を達成した。
  • 本手法は、1,000枚の合成学習画像のみを用いても、10万枚の画像で学習されたグローバル学習手法を著しく上回った。
  • 照明補正により、人間の可読性とOCR精度の両方が向上し、特に二重ネットワーク構成が最良の性能を発揮した。
  • 本手法は、楽譜やポスターなど学習データに含まれない文書タイプに対しても良好に一般化され、学習分布外の文書に対してもロバストであることが示された。
  • 勾配ドメイン統合技術により、目立つシームやアーチファクトが効果的に低減され、一貫性があり自然な補正画像が得られた。
  • 極端な状況(重度のしわだれ、レトロな手書き文書、高反射性のページなど)では、依然としてフローパターン推定が不正確になるという限界が残っている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。