Skip to main content
QUICK REVIEW

[論文レビュー] An Anchor-Free Region Proposal Network for Faster R-CNN based Text Detection Approaches

Zhuoyao Zhong, Lei Sun|arXiv (Cornell University)|Apr 24, 2018
Handwritten Text Recognition Techniques参考文献 15被引用数 16
ひとこと要約

本論文は、シーンテキスト検出のためのFaster R-CNNにおけるアンカーベースのRPNを置き換えるアンカーフリー領域提案ネットワーク(AF-RPN)を提案する。この手法はキーポイント回帰を用いてテキストインスタンスを直接予測することで、さまざまなスケール、アスペクト比、方向性を持つアンカーの手動設計の必要性を排除する。単一のResNet-50バックボーンと単一スケールのテストを用いて、ICDAR-2013、ICDAR-2015、ICDAR-2017ベンチマークで最先端の性能を達成し、COCO-Textでは高いリCALLを示し、検出精度も向上している。

ABSTRACT

The anchor mechanism of Faster R-CNN and SSD framework is considered not effective enough to scene text detection, which can be attributed to its IoU based matching criterion between anchors and ground-truth boxes. In order to better enclose scene text instances of various shapes, it requires to design anchors of various scales, aspect ratios and even orientations manually, which makes anchor-based methods sophisticated and inefficient. In this paper, we propose a novel anchor-free region proposal network (AF-RPN) to replace the original anchor-based RPN in the Faster R-CNN framework to address the above problem. Compared with a vanilla RPN and FPN-RPN, AF-RPN can get rid of complicated anchor design and achieve higher recall rate on large-scale COCO-Text dataset. Owing to the high-quality text proposals, our Faster R-CNN based two-stage text detection approach achieves state-of-the-art results on ICDAR-2017 MLT, ICDAR-2015 and ICDAR-2013 text detection benchmarks when using single-scale and single-model (ResNet50) testing only.

研究の動機と目的

  • シーンテキスト検出におけるアンカーベースの領域提案ネットワークの非効率性と複雑さに対処すること。
  • さまざまなスケール、アスペクト比、方向性を持つアンカーの手動設計の必要性を排除すること。
  • アンカーベースのRPNをアンカーフリーな代替手法に置き換えることで、シーンテキストデータセットにおけるリCALLと検出精度を向上させること。
  • 単一モデルおよび単一スケール入力で、標準的なテキスト検出ベンチマークで最先端の性能を達成すること。

提案手法

  • 事前に定義されたアンカーが不要なアンカーフリー領域提案ネットワーク(AF-RPN)を提案し、テキストインスタンスを直接予測する。
  • キーポイント回帰を用いてテキストインスタンスの左上隅と右下隅を予測し、エンドツーエンドの予測を可能にする。
  • テキストのサイズが異なる場合の多スケール特徴表現を強化するために、特徴マップピラミッド(FPN)構造を採用する。
  • Faster R-CNNにおけるアンカーベースのマッチング基準を、真値ボックス座標に基づく学習可能なアンカーフリー回帰戦略に置き換える。
  • キーポイントに基づく回帰に適応した標準的なRPN損失関数を用いて、AF-RPNをFaster R-CNNフレームワーク内でエンドツーエンドで訓練する。
  • 推論効率を維持しながら高い性能を達成するために、単一スケール入力とResNet-50バックボーンを採用する。

実験結果

リサーチクエスチョン

  • RQ1アンカーフリー領域提案ネットワークは、シーンテキスト検出においてアンカーベースのRPNを上回ることができるか?
  • RQ2手動によるアンカー設計を排除することで、挑戦的なテキスト検出ベンチマークにおけるリCALLと検出精度が向上するか?
  • RQ3単一モデル・単一スケール推論設定で、アンカーフリー手法を用いてテキスト検出で最先端の結果を達成できるか?
  • RQ4多様なテキスト形状や方向性を有するデータセットにおいて、AF-RPNはアンカーベースのベースラインと比べてどのように性能を発揮するか?

主な発見

  • AF-RPNは、大規模なCOCO-Textデータセットにおいて、アンロックされたRPNおよびFPN-RPNよりも高いリCALLレートを達成した。
  • 本手法は、単一のResNet-50モデルと単一スケール入力のみを用いて、ICDAR-2017 MLTベンチマークで新たな最先端の結果を樹立した。
  • ICDAR-2015およびICDAR-2013ベンチマークでも競争力のある性能を示し、同じ評価プロトコル下で既存のアンカーベース手法を上回った。
  • アンカーフリー設計により、アンカースケールおよびアスペクト比の膨大なハイパーパramータチューニングの必要性が排除され、パイプラインが簡素化された。
  • アンカー生成およびマッチングステップが存在しないため、高い推論効率を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。