[論文レビュー] Text/Graphics Separation for Business Card Images for Mobile Devices
本稿では、スマートフォンで撮影されたビジネスカード画像の計算効率の高いテキスト/グラフィック分離手法を提示する。背景の粗い除去には強度分散を用い、その後、特徴に基づくフィルタリングによりテキストとグラフィックを区別する。0.75メガピクセルの画像で98.54%の正確性を達成し、中程度のデスクトップシステムでも処理時間は0.17秒、メモリ使用量は1.1 MBにとどまり、モバイルデプロイメントに適していることが示された。
Separation of the text regions from background texture and graphics is an important step of any optical character recognition sytem for the images containg both texts and graphics. In this paper, we have presented a novel text/graphics separation technique for business card images captured with a cell-phone camera. At first, the background is eliminated at a coarse level based on intensity variance. This makes the foreground components distinct from each other. Then the non-text components are removed using various characteristic features of text and graphics. Finally, the text regions are skew corrected and binarized for further processing. Experimenting with business card images of various resolutions, we have found an optimum performance of 98.54% with 0.75 MP images, that takes 0.17 seconds processing time and 1.1 MB peak memory on a moderately powerful computer (DualCore 1.73 GHz Processor, 1 GB RAM, 1 MB L2 Cache). The developed technique is computationally efficient and consumes low memory so as to be applicable on mobile devices.
研究の動機と目的
- スマートフォンのカメラで撮影されたビジネスカード画像における、テキストとグラフィック、および背景テクスチャの分離の課題に対処すること。
- 限られた計算リソースを持つモバイルデバイスでリアルタイム処理が可能なほど、正確かつ効率的な手法を開発すること。
- 複雑で低解像度の画像における非テキスト成分からテキスト領域を分離することで、光学的文字認識(OCR)システムの性能を向上させること。
- 一般的にモバイルで撮影されるビジネスカードに見られる、さまざまな画像解像度や照明条件に対しても頑健であることを保証すること。
提案手法
- 背景の粗い除去には、局所的な強度分散を用い、前景成分と背景を区別する。
- 前景成分は、縦横比、ストローク幅、テクスチャパターンといった複数の特徴を用いて分析し、テキストまたは非テキスト(グラフィック/背景)に分類する。
- これらの特徴の統計的分析から導かれた事前定義されたしきい値に基づき、非テキスト成分をフィルタリングする。
- テキスト領域は、Hough変換に基づく線分検出を用いてずれ補正される。これによりOCRの正確性が向上する。
- 最終的なテキスト領域に対しては、適応的しきい値処理を用いた二値化が施され、コントラストが強化され、OCR処理に適した状態が得られる。
- パイプライン全体が低メモリおよび処理オーバーヘッドに最適化されており、モバイルプラットフォームへのデプロイメントが可能である。
実験結果
リサーチクエスチョン
- RQ1低複雑性の手法が、スマートフォンで撮影されたビジネスカード画像におけるテキスト、グラフィック、背景の分離を効果的に行えるか。
- RQ2リソース制約下で最適なテキスト領域検出を実現するには、強度分散と特徴ベースのフィルタリングのどの組み合わせが適しているか。
- RQ3スマートフォンのカメラで一般的に得られるさまざまな画像解像度において、この手法はどのように性能を発揮するか。
- RQ4処理時間とメモリ使用量を最小限に抑える中で、この手法がどれほど高い正確性を維持できるか。
主な発見
- 提案手法は、0.75メガピクセルのビジネスカード画像において98.54%のテキスト検出正確性を達成した。
- デュアルコア1.73 GHzプロセッサと1 GB RAM搭載のシステムでも処理時間はわずか0.17秒であり、リアルタイムのモバイル利用に適している。
- ピークメモリ使用量は1.1 MBにとどまり、一般的なモバイルデバイスの制約内に収まっている。
- 本手法は、モバイル撮影シナリオで一般的に見られるさまざまな画像解像度や照明条件に対しても、頑健な性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。