Skip to main content
QUICK REVIEW

[論文レビュー] Detecting Text in Natural Image with Connectionist Text Proposal Network

Zhi Tian, Weilin Huang|arXiv (Cornell University)|Sep 12, 2016
Handwritten Text Recognition Techniques参考文献 25被引用数 19
ひとこと要約

本稿では、畳み込み特徴マップ内の連続的で微細な提案同士を接続するために双方向LSTMを用い、垂直アンカーを活用することで、自然画像内のテキストラインを直接検出する深層学習モデル、Connectionist Text Proposal Network (CTPN) を提案する。この手法は、ICDAR 2013でF-measure 0.88、ICDAR 2015でF-measure 0.61の最先端性能を達成し、VGG16バックボーンを用いる場合の推論時間は1枚あたり0.14秒である。

ABSTRACT

We propose a novel Connectionist Text Proposal Network (CTPN) that accurately localizes text lines in natural image. The CTPN detects a text line in a sequence of fine-scale text proposals directly in convolutional feature maps. We develop a vertical anchor mechanism that jointly predicts location and text/non-text score of each fixed-width proposal, considerably improving localization accuracy. The sequential proposals are naturally connected by a recurrent neural network, which is seamlessly incorporated into the convolutional network, resulting in an end-to-end trainable model. This allows the CTPN to explore rich context information of image, making it powerful to detect extremely ambiguous text. The CTPN works reliably on multi-scale and multi- language text without further post-processing, departing from previous bottom-up methods requiring multi-step post-processing. It achieves 0.88 and 0.61 F-measure on the ICDAR 2013 and 2015 benchmarks, surpass- ing recent results [8, 35] by a large margin. The CTPN is computationally efficient with 0:14s/image, by using the very deep VGG16 model [27]. Online demo is available at: http://textdet.com/.

研究の動機と目的

  • 複数段階の後処理に依存し、誤検出の多い文字単位検出に依存する下位から上位へのテキスト検出手法の限界を解消すること。
  • 個々の文字ではなく、畳み込み特徴マップ内で直接テキストラインを検出することで、シーンテキストの局所化精度を向上させること。
  • 順序付けられた提案のテキスト有無、位置、補正オフセットを同時に予測する、エンドツーエンドで学習可能な深層ネットワークの構築を可能にすること。
  • 追加の後処理や言語固有の適応を必要とせず、マルチスケールおよびマルチランゲージテキストに対しても耐性を高めること。
  • ベンチマークデータセットで高い性能を発揮するとともに、リアルタイム推論に適した計算効率を維持すること。

提案手法

  • 特徴マップの高さにわたり固定幅のテキスト提案を生成する垂直アンカー機構を提案し、各アンカーがテキスト/非テキストスコアとy軸座標を予測する。
  • 隣接する提案同士の順序的依存関係をモデル化するために、双方向LSTM(BLSTM)を統合し、文脈に配慮した検出を可能にする。
  • 事前学習済みVGG16ネットワークの最終畳み込み層(conv5)を入力とし、各提案に対して3×3のスライディングウィンドウを用いて局所特徴を抽出する。
  • 各提案の特徴を左右および右から左への文脈を符号化する2本のRNNアーキテクチャを用いた二重スレッドRNN構造を採用し、局所化精度を向上させる。
  • 分類(テキスト/非テキスト)、ボクシングボックス回帰(y座標と側面補正)、および順序モデリングを統合したジョイント損失関数を用いて、ネットワーク全体をエンドツーエンドで学習する。
  • 推論段階では、重複する提案を抑制するために非最大抑制(NMS)を一度だけ適用し、複雑な後処理パイプラインへの依存を低減する。

実験結果

リサーチクエスチョン

  • RQ1深層ニューラルネットワークは、文字単位の検出に依存せずに、畳み込み特徴マップ内で完全なテキストラインを直接検出可能か?
  • RQ2独立した提案予測と比較して、順序的な提案の再帰的モデリングは、シーンテキスト検出における局所化精度をどのように向上させるか?
  • RQ3分類と回帰を統合した垂直アンカー機構は、スケールや言語が多様な困難なテキストに対して、検出性能をどの程度向上させるか?
  • RQ4エンドツーエンドで学習可能なアーキテクチャは、複数段階の後処理を伴う手法と比較して、精度と効率の両面で優れているか?
  • RQ5特徴抽出パイプライン内にRNNを統合することで、曖昧または小スケールのテキスト検出が向上するか?

主な発見

  • CTPNはICDAR 2013ベンチマークでF-measure 0.88を達成し、以前の最先端手法を大きく上回る性能を示した。
  • ICDAR 2015ベンチマークではF-measure 0.61を達成し、多様で困難なテキストインスタンスに対しても優れた一般化性能を示した。
  • 極めて小スケールで曖昧なテキストラインを高い精度で検出でき、一部のケースではアノテーションの正解を上回ることさえあった。
  • VGG16バックボーンを用いる場合、1枚あたりの推論時間は0.14秒であり、リアルタイム応用に適した計算効率を有している。
  • 言語固有の適応を必要とせず、中国語や韓国語を含むマルチランゲージテキストに対しても良好に一般化した。
  • 後処理への依存を低減することで、パイプラインが簡素化され、段階的な処理による誤差蓄積の低減が図られ、耐性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。