Skip to main content
QUICK REVIEW

[論文レビュー] FOTS: Fast Oriented Text Spotting with a Unified Network

Xuebo Liu, Ding Liang|arXiv (Cornell University)|Jan 5, 2018
Handwritten Text Recognition Techniques参考文献 70被引用数 8
ひとこと要約

FOTSは、新しいRoIRotate演算子を用いて畳み込み特徴を共有することで、テキスト検出と認識を統合的に実行するエンド・ツー・エンドで統一された深層学習フレームワークを提案する。この手法は、実時間推論(22.6 fps)を達成し、ICDAR 2015で先行手法を5%以上上回るF-measureを達成するが、単一タスクの検出ネットワークと比較して計算コストの増加は最小限に抑えられる。

ABSTRACT

Incidental scene text spotting is considered one of the most difficult and valuable challenges in the document analysis community. Most existing methods treat text detection and recognition as separate tasks. In this work, we propose a unified end-to-end trainable Fast Oriented Text Spotting (FOTS) network for simultaneous detection and recognition, sharing computation and visual information among the two complementary tasks. Specially, RoIRotate is introduced to share convolutional features between detection and recognition. Benefiting from convolution sharing strategy, our FOTS has little computation overhead compared to baseline text detection network, and the joint training method learns more generic features to make our method perform better than these two-stage methods. Experiments on ICDAR 2015, ICDAR 2017 MLT, and ICDAR 2013 datasets demonstrate that the proposed method outperforms state-of-the-art methods significantly, which further allows us to develop the first real-time oriented text spotting system which surpasses all previous state-of-the-art results by more than 5% on ICDAR 2015 text spotting task while keeping 22.6 fps.

研究の動機と目的

  • 検出と認識を別々のタスクとして扱う二段階のテキストスポットパイプラインにおける非効率性と最適でない特徴学習の問題を解決すること。
  • テキスト検出と認識を一つのエンド・ツー・エンドで学習可能なネットワークに統合し、特徴の共有を促進し、モデルの汎化性能を向上させること。
  • 回転したシーンテキストに対して精度を損なわず、実時間推論が可能な計算効率の高いシステムを構築すること。
  • 特徴マップ内の回転した領域の特徴抽出を可能にする微分可能RoIRotate演算子を導入すること。
  • ICDAR 2015、ICDAR 2017 MLT、ICDAR 2013などの標準ベンチマークで、既存手法を顕著に上回る性能向上を実証すること。

提案手法

  • テキスト検出と認識の両ブランチが初期の畳み込み特徴を共有する統合型の完全畳み込みネットワークを採用し、計算量を削減するとともに特徴学習を向上させる。
  • 回転したバウンディングボックスからの特徴抽出を可能にする微分可能な演算子として、RoIRotateを導入し、エンド・ツー・エンド学習を実現する。
  • テキスト検出は、回帰ヘッドと分類ヘッドを用いて回転バウンディングボックスを予測する完全畳み込みネットワークによって実行される。
  • 認識されたテキストは、RoIRotateで抽出された特徴をRNNエンコーダに通した後、シーケンス予測のためのCTCデコーダを用いて生成される。
  • 検出と認識の両方の損失関数による共同監視を用いて、ネットワーク全体をエンド・ツー・エンドで学習させ、補完的学習を実現する。
  • パラメータ共有とアーキテクチャの蒸留を活用してモデル効率を向上させ、実時間デプロイメントに適した軽量バージョン(FOTS RT)を実装し、ResNet-34を採用する。

実験結果

リサーチクエスチョン

  • RQ1テキスト検出と認識の共同エンド・ツー・エンド学習は、推論時間を短縮しつつ性能を向上させることができるか?
  • RQ2検出と認識の間での特徴共有は、モデルの汎化性能の向上と計算コストの低減にどの程度効果的か?
  • RQ3微分可能なRoIRotate演算子は、統合ネットワーク内で任意の方向のテキスト領域からの正確な特徴抽出を可能にするか?
  • RQ4検出と認識の両方の監視による共同学習は、複雑なシーンにおける誤検出の低減と局所化精度の向上にどの程度寄与するか?
  • RQ5統合フレームワークは、標準ベンチマークで精度を損なわず、実時間推論速度を達成できるか?

主な発見

  • FOTSはICDAR 2015のテキストスポットベンチマークで68.5%のF-measureを達成し、前回のSOTA手法を15ポイント以上上回った。
  • ICDAR 2015では、FOTS RTとして実時間モードで22.6 fpsで動作し、二段階ベースライン(3.7 fps)よりも著しく高速であり、単一検出ネットワーク(7.8 fps)に近い速度を達成した。
  • FOTSはICDAR 2013およびICDAR 2017 MLTの両データセットで、すべての既存手法を上回り、検出およびスポート精度の面で一貫した向上を示した。
  • RoIRotate演算子により、回転したテキスト領域からの正確な特徴抽出が可能になり、隣接するテキストインスタンスの分割や結合といった局所化誤差が低減された。
  • 認識の監視により文字レベルの詳細を学習することで、テキストに似た背景パターンの誤分類を回避し、誤検出を低減した。
  • 実時間バージョンでは28.79MパラメータでSOTA性能を達成し、高い効率性とスケーラビリティを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。