Skip to main content
QUICK REVIEW

[論文レビュー] ArbiText: Arbitrary-Oriented Text Detection in Unconstrained Scene

Daitao Xing, Zichen Li|arXiv (Cornell University)|Nov 30, 2017
Handwritten Text Recognition Techniques参考文献 31被引用数 6
ひとこと要約

ArbiText は、SSD フレームワーク内に円形アンカーとピラミッドプーリングモジュールを組み合わせることで、制約のないシーンにおける任意方向のテキストを、プロポーザルフリーでワンショットで検出する手法を提案する。長方形アンカーを円形アンカーに置き換え、マルチスケール特徴抽出を統合することで、ICDAR 2015 で 75.9%、MSRA-TD500 で 75.0% の最先端の F スコアを達成し、12.1 FPS の高速な推論速度を実現した。これは、困難な条件下でも回転・マルチリンガル・長文テキストを高精度かつ高効率に検出できる優れた性能を示している。

ABSTRACT

Arbitrary-oriented text detection in the wild is a very challenging task, due to the aspect ratio, scale, orientation, and illumination variations. In this paper, we propose a novel method, namely Arbitrary-oriented Text (or ArbText for short) detector, for efficient text detection in unconstrained natural scene images. Specifically, we first adopt the circle anchors rather than the rectangular ones to represent bounding boxes, which is more robust to orientation variations. Subsequently, we incorporate a pyramid pooling module into the Single Shot MultiBox Detector framework, in order to simultaneously explore the local and global visual information, which can, therefore, generate more confidential detection results. Experiments on established scene-text datasets, such as the ICDAR 2015 and MSRA-TD500 datasets, have demonstrated the supe rior performance of the proposed method, compared to the state-of-the-art approaches.

研究の動機と目的

  • 制約のない自然なシーンにおける任意方向、マルチスケール、マルチリンガルテキストを、高精度かつ高効率に検出する課題に対処すること。
  • シーンテキストの方向やアスペクト比の変動に対処するうえで、長方形アンカーの限界を克服すること。
  • ピラミッドプーリングモジュールを用いてローカルおよびグローバルな視覚的特徴を統合することで、検出のロバスト性を向上させること。
  • 領域プロポーザルネットワークの必要性を排除することで、計算効率を向上させること。
  • 可変サイズの円形アンカーに起因する曖昧なポジティブサンプルの処理に対応するための新しいマスク損失関数の開発

提案手法

  • 任意方向のテキストバウンディングボックスをよりよく表現するため、長方形アンカーの代わりに円形アンカーを採用する。
  • SSD フレームワークにピラミッドプーリングモジュールを統合し、マルチスケール特徴を抽出するとともに、ローカルおよびグローバルなコンテキストを保持する。
  • 可変サイズの円形アンカーに対するポジティブサンプルの割り当ての曖昧さを解消するため、新しいマスククラスを導入した修正損失関数を採用する。
  • ローカルな特徴の強化を図るため、ランダムクロッピング、水平反転、およびランダム回転(±15° から ±90°)を含むデータオーグメンテーションを適用する。
  • 重複する検出を抑制するために、後処理として局所性を考慮した非最大抑制(LANMS)を適用する。
  • 軽量な VGG-16 バックボーンを用いてエンドツーエンドで学習し、ICDAR 2015 および MSRA-TD500 データセットで微調整する。

実験結果

リサーチクエスチョン

  • RQ1可変スケールおよび方向の下でも、円形アンカーが長方形アンカーを上回る性能を示せるか?
  • RQ2ピラミッドプーリングモジュールの統合により、シーンテキストにおけるマルチスケールコンテキストを捉えることで、検出性能が向上するか?
  • RQ3プロポーザルフリーのワンショット検出器が、最先端の精度を維持しながら高い推論速度を達成できるか?
  • RQ4提案されたマスク損失関数は、可変サイズの円形アンカーおよび曖昧なポジティブサンプルの処理に対してどれほど効果的か?
  • RQ5アーキテクチャの変更なしに、長文テキストおよびマルチリンガルテキスト(非ラテン文字を含む)への一般化性能はどの程度高いか?

主な発見

  • ArbiText は、ICDAR 2015 Incidental Text データセットで 75.9% の F スコアを達成し、以前の最先端手法(Seglink)を 0.9 パcent point 上回った。
  • MSRA-TD500 データセットでは、F メジャーで最高性能を達成した手法と同等の 75.0% の F スコアを記録したが、推論速度が 12.1 FPS と最も速かった。
  • ハイパーパramータのチューニングなしに、長文およびマルチリンガルテキスト(英語と中国語の混合テキストを含む)への一般化性能が顕著に優れていた。
  • 円形アンカーの採用により、特に曲線または回転したテキストの状況下でも、方向変動に対する検出のロバスト性が著しく向上した。
  • 提案されたマスク損失関数は、ポジティブサンプルの割り当ての曖昧さを効果的に解消し、精度と再現率の向上に寄与した。
  • 失敗事例から、曲線および手書きテキストの検出に限界があることが明らかとなり、変形しやすいテキスト形状のモデル化の余地が残っていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。