Skip to main content
QUICK REVIEW

[論文レビュー] Exploring Geometric Property Thresholds For Filtering Non-Text Regions In A Connected Component Based Text Detection Application

Teresa Nicole Brooks|arXiv (Cornell University)|Sep 11, 2017
Handwritten Text Recognition Techniques参考文献 3被引用数 3
ひとこと要約

本稿は、MSERおよびストローク幅変動を用いた連結成分ベースのテキスト検出において、非テキスト領域をフィルタリングするための幾何的性質のしきい値を調査している。手動で調整されたアスペクト比、離心率、実体率、ストローク幅変動のしきい値が、自然および非自然なシーンの両方でテキストを効果的に検出できることを示している。特に、スタイリッシュで高コントラストな非自然画像では、ストローク幅の最大しきい値を高く設定し、拡張量を低減させることで検出性能が向上する。

ABSTRACT

Automated text detection is a difficult computer vision task. In order to accurately detect and identity text in an image or video, two major problems must be addressed. The primary problem is implementing a robust and reliable method for distinguishing text vs non-text regions in images and videos. Part of the difficulty stems from the almost unlimited combinations of fonts, lighting conditions, distortions, and other variations that can be found in images and videos. This paper explores key properties of two popular and proven methods for implementing text detection; maximum stable external regions (MSER) and stroke width variation.

研究の動機と目的

  • フォントスタイルおよび画像特徴(例:ぼけ、コントラスト、テクスチャ)がテキスト検出における幾何的性質のしきい値に与える影響を評価すること。
  • 多様な画像タイプにおいて、非テキスト領域を効果的にフィルタリングできる幾何的性質(例:アスペクト比、離心率、実体率)を特定すること。
  • 製品パッケージなどの非自然なシーンにおいても、MSERおよびストローク幅変動のテキスト検出の耐障害性を評価すること。
  • 非自然な画像における高ステイリングやカスタムフォントのテキスト検出性能を向上させるためのしきい値チューニング戦略を同定すること。
  • 実世界のテキスト検出システムにおけるスケーラビリティと耐障害性を向上させるために、しきい値選択の自動化の基盤を構築すること。

提案手法

  • グレースケール画像における初期領域検出に、最大安定外部領域(MSER)を採用した。
  • MSER領域からアスペクト比、離心率、実体率、拡張率、オイラー数といった幾何的性質を抽出し、非テキスト候補をフィルタリングした。
  • ストローク幅変動指標を適用:ストローク幅の標準偏差を平均ストローク幅で割った値にし、最大分散しきい値を用いた。
  • 標準偏差に基づくストレッチを用いたコントラスト強調を前処理として実装した。
  • 個々の文字検出を単語または行の候補に統合するために、バウンディングボックスの拡張およびマージを実装した。
  • テキスト認識にはMATLABのTesseractベースのOCRエンジンを用い、検出領域の視覚的点検と併せて結果を検証した。

実験結果

リサーチクエスチョン

  • RQ1自然および非自然なシーン画像における異なるフォントスタイルが、テキスト検出における最適な幾何的性質のしきい値にどのように影響を与えるか?
  • RQ2多様な画像タイプにおいて、テキストと非テキスト領域を区別するのに最も効果的な幾何的性質(例:アスペクト比、実体率、離心率)は何か?
  • RQ3高コントラスト、ぼけ、テクスチャといった画像固有の特徴が、信頼性のあるテキスト検出に必要なしきい値にどのように影響を与えるか?
  • RQ4カスタムフォントや高ステイリングフォントでは、ストローク幅変動およびバウンディングボックスの拡張パラメータにどの程度の調整が必要か?
  • RQ5MSERおよびストローク幅変動を用いた手動チューニングによる軽量システムが、自然および非自然なシーンの両方で堅牢なテキスト検出を達成できるか?

主な発見

  • 手動による幾何的しきい値のチューニングを経て、自然および非自然な画像の両方で主要および二次的なテキスト領域を正常に検出できた。
  • 非自然な画像では、すべての文字を検出するため、ストローク幅変動の最大しきい値を自然な画像と比較して2倍に引き上げる必要があった。
  • 隣接するバウンディングボックスの拡張量を低減させることで、非自然な画像における検出性能が向上し、特に幅広いまたは不規則に配置されたテキストに対して顕著であった。
  • 標準偏差に基づくストレッチによるコントラスト強調をさらに実行すると、高コントラスト画像では性能が低下した。これはしきい値効果が存在することを示唆している。
  • スタイリッシュフォントや高コントラストの影響にもかかわらず、MSERとストローク幅変動の組み合わせは堅牢であり、しきい値感度への影響は最小限に抑えられた。
  • Tesseractを用いたOCRモジュールは、再トレーニングなしで標準的な英語テキストを正常に認識できたが、カスタムフォントの対応には将来的なモデル再トレーニングが必要である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。