Skip to main content
QUICK REVIEW

[論文レビュー] A Single Shot Text Detector with Scale-adaptive Anchors

Yuan Qi, Bingwang Zhang|arXiv (Cornell University)|Jul 5, 2018
Handwritten Text Recognition Techniques参考文献 13被引用数 4
ひとこと要約

本論文は、スケールに適応するアンカーサイズを備えた1ショット、エンドツーエンドのテキスト検出器を提案する。このアンカーは学習されたスケール回帰層により動的にサイズを調整し、計算コストを低減するとともに、小規模なテキストの検出を向上させる。固定サイズのアンカーを連続的で適応可能なスケールに置き換え、受容 field を調整するためのアンカーコンボリューションを導入することで、1枚あたり0.28秒の推論時間で、ICDAR11およびICDAR13の最先端モデルを精度と効率の両面で上回る性能を達成する。

ABSTRACT

Currently, most top-performing text detection networks tend to employ fixed-size anchor boxes to guide the search for text instances. They usually rely on a large amount of anchors with different scales to discover texts in scene images, thus leading to high computational cost. In this paper, we propose an end-to-end box-based text detector with scale-adaptive anchors, which can dynamically adjust the scales of anchors according to the sizes of underlying texts by introducing an additional scale regression layer. The proposed scale-adaptive anchors allow us to use a few number of anchors to handle multi-scale texts and therefore significantly improve the computational efficiency. Moreover, compared to discrete scales used in previous methods, the learned continuous scales are more reliable, especially for small texts detection. Additionally, we propose Anchor convolution to better exploit necessary feature information by dynamically adjusting the sizes of receptive fields according to the learned scales. Extensive experiments demonstrate that the proposed detector is fast, taking only $0.28$ second per image, while outperforming most state-of-the-art methods in accuracy.

研究の動機と目的

  • マルチスケールのシーンテキスト検出における固定サイズアンカーボックスの非効率性と不正確さを解消すること。
  • マルチスケールテキスト検出に必要なアンカーバリエーション数を最小限に抑えることで、計算コストを低減すること。
  • 特に小規模でサイズが変動するテキストインスタンスに対して、検出のロバスト性を向上させること。
  • 離散的なアンカースケールに依存するのではなく、連続的なスケール予測を可能にすること。
  • アンカーコンボリューションを用いてアンカーのサイズに応じて受容 field を動的に適応させることで、特徴抽出を強化すること。

提案手法

  • 各アンカー位置に対して連続的なスケール値を予測するスケール回帰層を導入し、アンカーのサイズを動的に調整可能にする。
  • 予測されたスケール値を用いてアンカーボックスを適応的に再スケーリングし、複数の固定スケールアンカーを置き換える。
  • アンカーの学習済みスケールに応じて、各アンカーの有効な受容 field サイズを変更するアンカーコンボリューションを提案する。これにより特徴表現が向上する。
  • VGG16のConv4_3で1つの特徴マップでの予測戦略を採用し、スケールに適応するアンカーを組み合わせることで計算量を削減する。
  • モデル全体をエンドツーエンドで学習し、オブジェクトサイズの追加の教師信号を必要としない。
  • スケールに適応するメカニズムを活用することで、推論時間を著しく短縮しながらも高い精度を維持する。

実験結果

リサーチクエスチョン

  • RQ1固定サイズのアンカーをスケールに適応するものに置き換えることで、1ショットテキスト検出器が著しく短い推論時間で高い精度を達成できるか?
  • RQ2連続的なスケール予測が、小規模でサイズが変動するテキストインスタンスの検出において、離散的なアンカースケールを上回る性能を発揮するか?
  • RQ3アンカーコンボリューションによる動的受容 field の適応が、特徴品質と検出性能を向上させるか?
  • RQ4標準ベンチマーク上でのスピードと精度のトレードオフにおいて、提案手法は最先端の検出器と比較してどうなるか?
  • RQ5スケールに適応するメカニズムは、他のボックスベースの検出器へ一般化可能で、効率性の向上に寄与するか?

主な発見

  • 提案手法はICDAR11で85%のF-measure、ICDAR13で86%のF-measureを達成し、精度面で大多数の最先端手法を上回る。
  • 1枚あたり0.28秒の推論時間で動作し、TextBoxes(0.73秒)と比較して60%の短縮を達成し、推論効率が顕著に向上した。
  • 800×800の入力でもすべての小規模テキストインスタンスを検出できる一方、TextBoxesは最小アンカーサイズが大きいため一部を漏れてしまう。
  • スケールに適応するアンカーにより連続的なスケール予測が可能となり、特に小規模テキストに対して離散スケールよりも信頼性が高まる。
  • アンカーコンボリューションにより、アンカーのサイズに応じて受容 field を適応的に調整し、特徴抽出が向上し、検出性能が向上した。
  • 複数のスケール予測を1つのスケール回帰層に置き換えることで、計算複雑度をO(n)からO(1)に削減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。