Skip to main content
QUICK REVIEW

[論文レビュー] MOST: A Multi-Oriented Scene Text Detector with Localization Refinement

Minghang He, Minghui Liao|arXiv (Cornell University)|Apr 2, 2021
Handwritten Text Recognition Techniques参考文献 43被引用数 4
ひとこと要約

本稿では、テキスト特徴アライメントモジュール(TFAM)による動的受容 field の適応、位置に配慮した非最大抑制(PA-NMS)、インスタンス単位のIoU損失によるバランスの取れた学習を特徴とする、マルチオントローラー・シーンテキスト検出器MOSTを提案する。本手法は、MLT17、MTWI、MSRA-TD500ベンチマークで最先端性能を達成し、51.8 FPSという高速な推論速度を実現した。

ABSTRACT

Over the past few years, the field of scene text detection has progressed rapidly that modern text detectors are able to hunt text in various challenging scenarios. However, they might still fall short when handling text instances of extreme aspect ratios and varying scales. To tackle such difficulties, we propose in this paper a new algorithm for scene text detection, which puts forward a set of strategies to significantly improve the quality of text localization. Specifically, a Text Feature Alignment Module (TFAM) is proposed to dynamically adjust the receptive fields of features based on initial raw detections; a Position-Aware Non-Maximum Suppression (PA-NMS) module is devised to selectively concentrate on reliable raw detections and exclude unreliable ones; besides, we propose an Instance-wise IoU loss for balanced training to deal with text instances of different scales. An extensive ablation study demonstrates the effectiveness and superiority of the proposed strategies. The resulting text detection system, which integrates the proposed strategies with a leading scene text detector EAST, achieves state-of-the-art or competitive performance on various standard benchmarks for text detection while keeping a fast running speed.

研究の動機と目的

  • 極端なアスペクト比を示す長大なテキストインスタンスに対して、既存の検出器が示す低い局所化精度を是正すること。
  • 大規模なスケール変動を示すテキストインスタンスにおける検出性能を向上させること。
  • 多言語およびWebベースの画像を含む多様なデータセットにおいて、ワンステージ検出器のロバスト性と一般化性能を向上させること。
  • 軽量でモジュラーなコンponentsを用いることで、検出品質を向上させながらも高い推論速度を維持すること。

提案手法

  • テキスト特徴アライメントモジュール(TFAM)は、粗い検出予測に基づいて特徴マップの受容 field を動的に調整し、長大なテキストにおけるより良いコンテキストモデリングを可能にする。
  • 位置に配慮した非最大抑制(PA-NMS)は、空間的位置に基づいて信頼性の高い予測に焦点を当てて、元の検出結果を効果的に統合することで、幾何的バイアスを低減する。
  • インスタンス単位のIoU損失は、各テキストインスタンスの損失関数への寄与をバランスさせるために導入され、さまざまなスケールにわたる公平な最適化を保証する。
  • 本手法はEAST検出器と統合されており、ResNet-50-FPNバックボーンを用い、分類ヘッド、局所化ブランチ、位置に敏感なマップ予測ヘッドを備えている。
  • 局所化ブランチは、粗い局所化ヘッド、TFAM、および精緻化された局所化ヘッドから構成され、バウンディングボックスの回帰精度を向上させる。
  • 全体のパイプラインは単純かつ効率的であり、高精度を維持しながらも高速な推論を実現している。

実験結果

リサーチクエスチョン

  • RQ1動的受容 field の適応は、極端なアスペクト比を示す長大なテキストインスタンスの局所化精度を向上させることができるか?
  • RQ2位置に配慮した抑制は、信頼性の高い検出結果に優先順位を付けることで、NMSにおける幾何的バイアスを低減できるか?
  • RQ3インスタンス単位のIoU損失は、スケールが異なるテキストインスタンスにわたる一般化性能を向上させるか?
  • RQ4提案されたコンponentsは、推論速度を犠牲にすることなく、多言語および長大テキストデータセットにおける検出性能を向上させることができるか?

主な発見

  • MSRA-TD500テストセットでは、90.4%の精度、82.7%のリコール、86.4%のF-measureを達成し、以前の最先端手法よりF-measureで1.5%高い性能を示した。
  • MLT17ベンチマークでは、76.7%のF-measureを達成し、2段階モデルを含むすべての比較手法を上回り、リコール率が1.9%高い結果を示した。
  • MTWIデータセットでは、74.7%のF-measureを達成し、すべてのベースラインを最低1.2%以上上回り、多言語およびWebベースのテキストに対する強力な一般化性能を示した。
  • MLT17バリデーションセットでは、51.8 FPSという高速な推論速度を達成し、高精度を維持しながらも単純なパイプラインを保った。
  • アブレーションスタディの結果、TFAM、PA-NMS、インスタンス単位のIoU損失の各コンponentが性能向上に顕著な寄与をしていることが確認され、異なるIoU閾値下で4.0%および9.5%の向上が得られた。
  • 提案された戦略は一般化可能であり、他のワンステージテキスト検出フレームワークへの容易な拡張が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。