Skip to main content
QUICK REVIEW

[論文レビュー] Arbitrary Shape Scene Text Detection with Adaptive Text Region Representation

Xiaobing Wang, Yingying Jiang|arXiv (Cornell University)|May 15, 2019
Handwritten Text Recognition Techniques参考文献 32被引用数 13
ひとこと要約

本論文は、反復的に境界点を予測することで任意形状のテキスト領域を検出する、再帰的ニューラルネットワーク(RNN)を用いた適応的テキスト領域表現を提案する。この手法は、CTW1500 や MSRA-TD500 などの曲がったテキストや多方向テキストを含む5つのベンチマークで最先端の性能を達成している。

ABSTRACT

Scene text detection attracts much attention in computer vision, because it can be widely used in many applications such as real-time text translation, automatic information entry, blind person assistance, robot sensing and so on. Though many methods have been proposed for horizontal and oriented texts, detecting irregular shape texts such as curved texts is still a challenging problem. To solve the problem, we propose a robust scene text detection method with adaptive text region representation. Given an input image, a text region proposal network is first used for extracting text proposals. Then, these proposals are verified and refined with a refinement network. Here, recurrent neural network based adaptive text region representation is proposed for text region refinement, where a pair of boundary points are predicted each time step until no new points are found. In this way, text regions of arbitrary shapes are detected and represented with adaptive number of boundary points. This gives more accurate description of text regions. Experimental results on five benchmarks, namely, CTW1500, TotalText, ICDAR2013, ICDAR2015 and MSRATD500, show that the proposed method achieves state-of-the-art in scene text detection.

研究の動機と目的

  • 既存の手法が困難とされる、曲がったテキストや多方向テキストを含む任意形状のシーンテキストの検出という課題に対処すること。
  • 固定されたバウンディングボックスの代わりに、適応的で可変長の境界点表現を用いることで、不規則なテキスト領域の検出精度を向上させること。
  • 照明の変化、言語、テキスト長の違いを含む多様な現実世界の状況において、効率的かつ正確にシーンテキストを検出できること。
  • 高精度な検出性能を複数のベンチマークデータセットで達成するとともに、高い推論速度を維持すること。

提案手法

  • 入力画像から初期のテキスト候補を生成するため、テキスト領域提案ネットワーク(Text-RPN)を用いる。
  • テキスト/非テキスト分類、バウンディングボックス回帰、およびRNNベースの適応的境界点予測の3本のブランチを備えたリファインメントネットワークを用いて候補を精緻化する。
  • 各タイムステップで一対の境界点を予測するRNNを用い、ストップ信号が発行されるまで繰り返すことで、任意形状のテキスト領域の可変長表現を可能にする。
  • 各テキスト候補に対して、CNNバックボーンからROIプーリングを用いて特徴マップを抽出し、それをリファインメントネットワークに供給して正確な局所化を実現する。
  • 分類、局所化、および適応的境界点生成を同時に最適化するマルチタスク学習により、エンドツーエンドでモデルを訓練する。
  • 検出されたテキスト領域を、可変数のペア境界点で表現することで、曲がった形状や不規則な形状を柔軟かつ正確にモデル化できる。

実験結果

リサーチクエスチョン

  • RQ1固定されたバウンディングボックス表現と比較して、RNNベースの適応的境界点予測機構は、任意形状のシーンテキストの検出精度を向上させることができるか?
  • RQ2本手法は、CTW1500 や MSRA-TD500 のような、困難な曲がったテキストや多方向テキストを含むベンチマークで、どのように性能を発揮するか?
  • RQ3不規則なテキスト検出において、最先端の正確性を達成しつつ、高い推論速度を維持できるか?
  • RQ4適応的表現戦略は、多言語、長いテキストライン、低照度条件を含む多様なシーンテキストシナリオに一般化して適応できるか?

主な発見

  • CTW1500ベンチマークにおいて、本手法は平均H-mean 78.5%を達成し、以前の最先端手法であるTextSnake(78.4%)やMask Textspotter(78.4%)を上回った。
  • MSRA-TD500データセットでは、H-mean 83.6%を達成し、InceptText(83.0%)やMCN(83.0%)をすべて上回った。
  • ICDAR2013では、H-mean 91.7%を達成し、単一スケール・単一モデル評価下で最高性能を示したMask Textspotterと同等の結果を出した。
  • ICDAR2015では、H-mean 87.6%を達成し、FOTS(エンドツーエンドの検出と認識訓練を用いる)を除き、ほとんどの手法を上回った。
  • 720×720の入力に対して10.0 fpsで動作し、TextSnake(1.1 fps)やMask Textspotter(6.9 fps)よりも顕著に高速であった。これは、ピixe単位の予測を回避することで実現した。
  • 定性的な結果から、曲がったテキスト、多言語コンテンツ、長いテキストライン、照明条件の違いなど、多様なシナリオにおいても頑健な性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。