Skip to main content
QUICK REVIEW

[論文レビュー] Reading Text in the Wild with Convolutional Neural Networks

Max Jaderberg, Karen Simonyan|arXiv (Cornell University)|Dec 4, 2014
Handwritten Text Recognition Techniques参考文献 20被引用数 20
ひとこと要約

この論文は、畳み込みニューラルネットワーク(CNN)と領域提案手法を用いて、自然なシーン画像におけるテキストスポットのためのエンドツーエンドのディープラーニングシステムを提示する。高再現率の領域提案と、人間がアノテートした現実世界のデータに依存しない合成データのみで訓練されたCNNベースの単語認識モデルを組み合わせることで、人間のアノテーションデータを一切使わずに正確でスケーラブルなテキスト検出および認識を実現し、最先端の性能を達成する。

ABSTRACT

In this work we present an end-to-end system for text spotting -- localising and recognising text in natural scene images -- and text based image retrieval. This system is based on a region proposal mechanism for detection and deep convolutional neural networks for recognition. Our pipeline uses a novel combination of complementary proposal generation techniques to ensure high recall, and a fast subsequent filtering stage for improving precision. For the recognition and ranking of proposals, we train very large convolutional neural networks to perform word recognition on the whole proposal region at the same time, departing from the character classifier based systems of the past. These networks are trained solely on data produced by a synthetic text generation engine, requiring no human labelled data. Analysing the stages of our pipeline, we show state-of-the-art performance throughout. We perform rigorous experiments across a number of standard end-to-end text spotting benchmarks and text-based image retrieval datasets, showing a large improvement over all previous methods. Finally, we demonstrate a real-world application of our text spotting system to allow thousands of hours of news footage to be instantly searchable via a text query.

研究の動機と目的

  • 検出と認識を1つのパイプラインで統合するエンドツーエンドのシステムを、自然なシーン画像におけるテキストスポットに開発すること。
  • フォント、照明、向きのばらつきが大きい非制約的環境におけるテキスト認識の正確性を向上させること。
  • 認識モデルを合成データのみで訓練することで、人間がアノテートしたトレーニングデータの必要性を排除すること。
  • 大規模な動画コーパスにわたるテキストベースの画像検索をスケーラブルかつリアルタイムで可能にすること。
  • マルチステージのフィルタリングと精練により、検出の高再現率を維持しながら高精度を実現すること。

提案手法

  • エッジベースの領域提案(エッジボックス)とスライディングウィンドウ検出器を組み合わせ、高再現率の単語バウンディングボックスの候補を生成する。
  • ランダムフォレスト分類器を用いて誤検出をフィルタリングし、候補数を削減しながら真陽性を保持する。
  • 残りの候補の座標を精練するために、バウンディングボックス回帰のためのCNNを適用し、局所化の正確性を向上させる。
  • 大規模なCNNを用いて、提案領域全体に対してエンドツーエンドの単語認識を実行し、90,000語の辞書に対して分類する。
  • 認識用のCNNを、人間によるアノテーションを一切行わず、テキストレンダリングエンジンで生成された合成テキストデータのみで訓練する。
  • 認識タスクにおける多数のクラスを扱うために、インクリメンタル学習戦略を適用する。

実験結果

リサーチクエスチョン

  • RQ1人間のアノテーションデータを一切使わず、合成データでのみ訓練されたディープCNNベースの認識モデルは、実世界のシーンテキスト認識で既存のシステムを上回ることができるか?
  • RQ2領域提案とフィルタリングを組み合わせたマルチステージ検出パイプラインは、従来の検出手法よりも高い再現率を達成できるか?
  • RQ3検出と認識をエンドツーエンドのシステムに統合することで、テキストスポットおよび画像検索ベンチマークでの性能が著しく向上するか?
  • RQ4人間のアノテーションが一切ない状態で、合成データで訓練されたモデルは、実世界のテキスト認識にどれほど一般化できるか?
  • RQ5大規模な動画コーパスに対して、リアルタイムのテキストベースの画像検索をスケーラブルに実現できるか?

主な発見

  • SVTテキスト検索ベンチマークで86.3%の平均平均精度(mAP)を達成し、既存の手法を顕著に上回った。
  • ICDAR 2003およびストリートビュー・テキストデータセットでは、検出段階で約98%の単語再現率を達成し、以前の手法を上回った。
  • 人間がアノテートした実世界のラベルデータを一切使用せず、合成データでのみ訓練された認識モデルが、実世界のシーンテキスト認識で最先端の正確性を達成した。
  • 1つのCPUコアおよびGPU上で、1枚の画像あたり5〜20秒で処理が可能であり、ハイエンドハードウェアでは1〜2枚/秒のスケーリングが可能である。
  • 実世界の応用において、5,000時間にわたるBBCニュース動画コーパス上で、「hollywood」や「boris johnson」などのクエリに対して、100件目まで100%の精度(P@100)を達成した。
  • SVTやスポーツデータセットのようなテストセットにおける不完全なアノテーションが、報告されたmAPを低く見せている可能性があり、実際の性能は報告値よりも高い可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。