Skip to main content
QUICK REVIEW

[論文レビュー] Omnidirectional Scene Text Detection with Sequential-free Box Discretization

Yuliang Liu, Sheng Zhang|arXiv (Cornell University)|Jun 6, 2019
Handwritten Text Recognition Techniques参考文献 17被引用数 13
ひとこと要約

本稿では、四角形バウンディングボックスを不変のキーエッジ(KEs)にパラメータ化することにより、順序依存のラベルに依存しない新しい手法であるSequential-free Box Discretization(SBD)を提案する。SBDは、ラベル順序への感受性を排除することで、検出精度と一般化性能を向上させ、ICDAR2015、MLT、MSRA-TD500、HRSC2016の各ベンチマークでSOTA手法を上回り、mAPで最大7.7%向上を達成。Mask R-CNNに統合した際には、Hmeanで2.4%の向上を示した。

ABSTRACT

Scene text in the wild is commonly presented with high variant characteristics. Using quadrilateral bounding box to localize the text instance is nearly indispensable for detection methods. However, recent researches reveal that introducing quadrilateral bounding box for scene text detection will bring a label confusion issue which is easily overlooked, and this issue may significantly undermine the detection performance. To address this issue, in this paper, we propose a novel method called Sequential-free Box Discretization (SBD) by discretizing the bounding box into key edges (KE) which can further derive more effective methods to improve detection performance. Experiments showed that the proposed method can outperform state-of-the-art methods in many popular scene text benchmarks, including ICDAR 2015, MLT, and MSRA-TD500. Ablation study also showed that simply integrating the SBD into Mask R-CNN framework, the detection performance can be substantially improved. Furthermore, an experiment on the general object dataset HRSC2016 (multi-oriented ships) showed that our method can outperform recent state-of-the-art methods by a large margin, demonstrating its powerful generalization ability. Source code: https://github.com/Yuliang-Liu/Box_Discretization_Network.

研究の動機と目的

  • 四角形ベースのシーンテキスト検出における順序依存ラベリングによって引き起こされるラベルの混乱問題を解決すること。
  • 多方向テキスト検出におけるバウンディングボックス回帰において、ラベル順序の順序依存性を排除すること。
  • 不変のキーエッジ(KEs)を用いた順序フリーのバウンディングボックスパラメータライゼーションを導入することで、検出の信頼性と性能を向上させること。
  • シーンテキストを越えた多方向オブジェクト検出タスク、例えば多方向の船検出などへの一般化を示すこと。
  • 特にMask R-CNNに統合した場合に、最小限のアーキテクチャ変更でSOTA性能を達成すること。

提案手法

  • SBDは、ラベル順序に依存しない不変の幾何的点(例えば、中心点や対角線の交点)から導出される4つのキーエッジ(KEs)に四角形バウンディングボックスを離散化する。
  • 予測されたKEsと真値のKEsを点の順序に依存せずに一致させる、新しいマッチング戦略を導入する。
  • Mask R-CNNフレームワークにKEsを予測する新しいブランチを追加し、順序フリーの監視を可能にするとともに、ラベルの混乱を低減する。
  • 後処理段階では、KEから得られる座標を用いて、よりタイトで正確な四角形バウンディングボックスを再構築する。
  • さらに検出結果を精緻化するために、ガンマパラメータを用いた信頼度ベースの再スコアリング戦略を採用する。
  • 本手法はエンドツーエンドで学習可能であり、既存のインスタンスセグメンテーションおよび検出パイプラインと互換性を保つ。

実験結果

リサーチクエスチョン

  • RQ1四角形バウンディングボックスの順序フリーなパラメータライゼーションは、ラベルの混乱を低減し、検出のロバストネスを向上させることができるか?
  • RQ2KEsに不変の幾何的点を用いることで、ラベル順序の不一致によって引き起こされる性能低下が解消されるか?
  • RQ3SBDは、アーキテクチャの大幅な見直しを伴わずに、Mask R-CNNにスムーズに統合可能か?
  • RQ4SBDは、シーンテキストを越えた他の多方向オブジェクト検出タスクに対しても一般化できるか?
  • RQ5SBDは、さまざまなデータオーグメンテーションおよびアノテーションノイズの条件下で、SOTA手法と比較してどのように性能を示すか?

主な発見

  • Mask R-CNNに統合した際、ICDAR2015でHmeanが2.4%向上し、再スコアリングを適用することでさらに0.6%向上した。
  • HRSC2016の船検出ベンチマークでは93.7%のmAPを達成し、以前のSOTA手法RRDを7.7%上回った。
  • SBDはラベル順序の摂動に対してロバストである:訓練データにランダム回転を追加した場合、Hmeanはわずか0.3%低下したが、Eastでは9.7%、CTDでは13.7%低下した。
  • アブレーションスタディにより、SBDが検出の信頼性を向上させ、よりタイトな予測のための効果的な後処理を可能にすることが確認された。
  • 限られた訓練データでも強力な性能を維持する。HRSC2016の実験では、訓練にわずか2時間で実施された。
  • 本手法は優れた一般化性能を示し、MLT、ICDAR2015、MSRA-TD500を含む複数のベンチマークでSOTA手法を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。