Skip to main content
QUICK REVIEW

[論文レビュー] Feature Enhancement Network: A Refined Scene Text Detector

Sheng Zhang, Yuliang Liu|arXiv (Cornell University)|Nov 12, 2017
Handwritten Text Recognition Techniques参考文献 27被引用数 17
ひとこと要約

本論文は、小規模・細長いテキストの検出を向上させるために、低レベルおよび高レベル特徴のタスク固有の統合を組み込んだ特徴強化ネットワーク(FEN)を提案する。小分けされたサンプルの不均衡を解消するため、適応的重み付き位置感受性RoIプーリング層とポジティブサンプルマイニング戦略を導入し、エンドツーエンド学習でICDAR 2011および2013ベンチマークで最先端のF-measureを達成した。

ABSTRACT

In this paper, we propose a refined scene text detector with a extit{novel} Feature Enhancement Network (FEN) for Region Proposal and Text Detection Refinement. Retrospectively, both region proposal with extit{only} $3 imes 3$ sliding-window feature and text detection refinement with extit{single scale} high level feature are insufficient, especially for smaller scene text. Therefore, we design a new FEN network with extit{task-specific}, extit{low} and extit{high} level semantic features fusion to improve the performance of text detection. Besides, since extit{unitary} position-sensitive RoI pooling in general object detection is unreasonable for variable text regions, an extit{adaptively weighted} position-sensitive RoI pooling layer is devised for further enhancing the detecting accuracy. To tackle the extit{sample-imbalance} problem during the refinement stage, we also propose an effective extit{positives mining} strategy for efficiently training our network. Experiments on ICDAR 2011 and 2013 robust text detection benchmarks demonstrate that our method can achieve state-of-the-art results, outperforming all reported methods in terms of F-measure.

研究の動機と目的

  • 既存のシーンテキスト検出器が小規模・細長いテキスト領域を検出する際の限界を解消すること。
  • タスク固有の方法で低レベルおよび高レベルの意味的特徴を統合することで、検出精度を向上させること。
  • 精緻化段階におけるサンプル不均衡を効果的なポジティブサンプルマイニング戦略により解消すること。
  • 適応的重み付き位置感受性RoIプーリング層を用いて、領域提案と検出精緻化を向上させること。
  • 標準的なICDAR 2011および2013ベンチマークで、強力なシーンテキスト検出のための最先端のパフォーマンスを達成すること。

提案手法

  • テキスト検出における特徴表現を向上させるために、低レベルおよび高レベル特徴を統合する特徴強化ネットワークスタブ(FENS)を提案する。
  • 領域提案と検出精緻化を強化するため、特徴強化RPN(FE-RPN)とハイパーフィーチャ生成モジュールを導入する。
  • テキスト領域の可変的なアスペクト比に対応してより効果的に処理できるように、適応的重み付き位置感受性RoIプーリング層を設計する。
  • トレーニング中にフォアグラウンドとバックグラウンドのサンプルのバランスを改善し、モデルの収束性を高めるために、ポジティブサンプルマイニング戦略を開発する。
  • 異なる入力解像度における予測を集約するために、マルチスケールテストと非最大抑制(NMS)を採用する。
  • 領域提案段階と精緻化段階を統合的に最適化する手法を用いて、エンドツーエンドでネットワーク全体を学習する。

実験結果

リサーチクエスチョン

  • RQ1タスク固有の低レベルおよび高レベル特徴の統合は、小規模・細長いシーンテキストの検出性能を向上させることができるか?
  • RQ2適応的重み付き位置感受性RoIプーリングは、可変的なアスペクト比を持つテキスト領域の検出において、標準的なユニタリプーリングを上回る性能を示すか?
  • RQ3専用のポジティブサンプルマイニング戦略は、検出精緻化段階におけるサンプル不均衡を効果的に緩和できるか?
  • RQ4提案されたFENフレームワークは、既存の最先端手法と比較して、標準的なICDARベンチマークにおけるF-measureをどの程度向上させるか?

主な発見

  • 提案されたFENフレームワークは、ICDAR 2011および2013データセットにおいて、元のR-FCNベースラインと比較して平均リcallが5%向上し、F-measureが3%向上した。
  • 適応的重み付き位置感受性RoIプーリングは、標準プーリングと比較して、ICDAR 2013でF-measureが1.9%向上、ICDAR 2011で1.1%向上した。
  • ポジティブサンプルマイニング戦略により、フォアグラウンド対バックグラウンドのサンプル比が1:4未満から約2:5に改善され、深刻なクラス不均衡が解消された。
  • マルチスケールテストを適用した結果、ICDAR 2011および2013ベンチマークの両方で最先端のF-measureを達成し、これまでに報告されたすべての手法を上回った。
  • 入力サイズの短辺が720と短くても、性能を維持したため、入力解像度の変動に対して高いロバストネスを示した。
  • 強化されたアーキテクチャを備えながらも、他の最先端手法と同等の高速な推論速度を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。