Skip to main content
QUICK REVIEW

[論文レビュー] Text/Graphics Separation and Skew Correction of Text Regions of Business Card Images for Mobile Devices

Ayatullah Faruk Mollah, Subhadip Basu|arXiv (Cornell University)|Feb 21, 2010
Handwritten Text Recognition Techniques参考文献 9被引用数 6
ひとこと要約

本稿では、モバイルデバイスで撮影された名刺画像からのテキストとグラフィックの分離およびずれ補正を、計算効率の高い方法で実現する手法を提示する。明るさの分散を用いた粗い背景除去の後、特徴に基づくフィルタリングによりテキスト領域と非テキスト領域を区別する。0.75 MP解像度の画像において98.25%のリCALLを達成し、中程度のデスクトップシステム上での処理時間は0.17秒、メモリ使用量は1.1 MBにとどまり、モバイルデプロイメントに適していることが示された。

ABSTRACT

Separation of the text regions from background texture and graphics is an important step of any optical character recognition system for the images containing both texts and graphics. In this paper, we have presented a novel text/graphics separation technique and a method for skew correction of text regions extracted from business card images captured with a cell-phone camera. At first, the background is eliminated at a coarse level based on intensity variance. This makes the foreground components distinct from each other. Then the non-text components are removed using various characteristic features of text and graphics. Finally, the text regions are skew corrected for further processing. Experimenting with business card images of various resolutions, we have found an optimum performance of 98.25% (recall) with 0.75 MP images, that takes 0.17 seconds processing time and 1.1 MB peak memory on a moderately powerful computer (DualCore 1.73 GHz Processor, 1 GB RAM, 1 MB L2 Cache). The developed technique is computationally efficient and consumes low memory so as to be applicable on mobile devices.

研究の動機と目的

  • 低解像度のモバイルカメラで撮影された名刺画像において、背景のグラフィックからテキスト領域を正確に分離する課題に対処すること。
  • 限られた処理能力を有するモバイルデバイスへのデプロイメントを想定し、計算効率的かつメモリ軽量な手法を開発すること。
  • 抽出されたテキスト領域のずれ補正により、その後行う光学的文字認識(OCR)の精度を向上させること。
  • モバイルで撮影された名刺画像に一般的に見られる、さまざまな解像度および画質レベルにおいても、堅牢な性能を発揮すること。

提案手法

  • フォアグラウンドとバックグラウンドのコンポONENT間のコントラストを向上させるために、局所的な明るさの分散を用いた初期的な粗い背景抑制を実施する。
  • アスペクト比、ストローク幅、連結性といった幾何学的・構造的特徴に基づき、フォアグラウンドコンポONENTを潜在的なテキスト領域と非テキスト領域にセグメンテーションする。
  • グラフィックに特徴的な形状記述子と空間的分布パターンの組み合わせを用いて、非テキストコンポONENTをフィルタリングする。
  • テキスト領域のずれ角度は、水平および垂直方向の投影プロファイル分析を用いて分析する。
  • 計算された角度に従って、テキスト領域を基線に合わせて回転させることでずれ補正を実施する。
  • モバイルプラットフォームでの実現可能性を確保するため、計算負荷とメモリ消費量を最小限に抑えたパイプライン全体の最適化を実施する。

実験結果

リサーチクエスチョン

  • RQ1どのようにすれば、モバイルデバイスで撮影された低解像度の名刺画像において、テキストとグラフィックを効果的に分離できるか?
  • RQ2複雑な背景において、テキストと非テキストコンポONENTを信頼性高く識別するための画像特徴の組み合わせは何か?
  • RQ3ずれ補正は、モバイルで撮影された名刺画像に対するOCR精度をどの程度向上させ得るか?
  • RQ4提案手法の計算的およびメモリ的オーバーヘッドは何か?また、モバイルハードウェア上で効率的にデプロイ可能か?

主な発見

  • 本手法は、0.75 MP解像度の名刺画像において98.25%のリCALLを達成しており、テキスト領域検出の高精度を示している。
  • デュアルコア1.73 GHzプロセッサと1 GB RAM搭載のシステム上では処理時間がわずか0.17秒にとどまり、リアルタイム処理の可能性を示している。
  • ピークメモリ使用量は1.1 MBに限定されており、リソース制限のあるモバイル環境に適している。
  • さまざまな解像度および背景の複雑さを有する画像に対しても、高い堅牢性を維持して処理を実行できる。
  • 明るさの分散に基づくセグメンテーションと特徴に基づくフィルタリングの組み合わせにより、複雑な学習段階を必要とせず、正確なテキスト抽出が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。