Skip to main content
QUICK REVIEW

[論文レビュー] All You Need Is Boundary: Toward Arbitrary-Shaped Text Spotting

Hao Wang, Pu Lu|arXiv (Cornell University)|Nov 21, 2019
Handwritten Text Recognition Techniques参考文献 33被引用数 5
ひとこと要約

本論文は、任意形状のテキストを境界ボックスやセグメンテーションマスクの代わりに境界点の集合として表現する、画期的なエンドツーエンドのテキストスポットフレームワークを提案する。粗い段階から細かい段階への検出パイプラインを用い、方向付き長方形領域提案 followed by 微分可能境界点回帰と補正を行うことで、文字レベルのアノテーションを必要とせず、ICDAR2015、TotalText、COCO-Textのすべてのベンチマークで最先端の性能を達成した。

ABSTRACT

Recently, end-to-end text spotting that aims to detect and recognize text from cluttered images simultaneously has received particularly growing interest in computer vision. Different from the existing approaches that formulate text detection as bounding box extraction or instance segmentation, we localize a set of points on the boundary of each text instance. With the representation of such boundary points, we establish a simple yet effective scheme for end-to-end text spotting, which can read the text of arbitrary shapes. Experiments on three challenging datasets, including ICDAR2015, TotalText and COCO-Text demonstrate that the proposed method consistently surpasses the state-of-the-art in both scene text detection and end-to-end text recognition tasks.

研究の動機と目的

  • 不規則な形状のテキスト(特に曲がったまたは傾いたテキスト)を表現する際の長方形境界ボックスの限界を解消すること。
  • エンドツーエンドのテキストスポットで高価な文字レベルアノテーションの必要性を排除すること。
  • 微分可能境界点回帰によるテキスト境界の正確な局所化を通じて、特徴抽出と認識精度の向上を図ること。
  • 統一的かつ微分可能なパイプラインにより、検出と認識の有効な共同最適化を可能にすること。

提案手法

  • 本手法は、テキストインスタンスのための方向付き長方形ボックスを最初に予測する2段階検出器を使用する。
  • 各方向付きRoI内の特徴から、専用の境界点検出ネットワークを用いて境界点を回帰する。
  • 微分可能な変換により、不規則な境界点を水平方向のリクラクト領域にマップする。
  • Arbitrary RoIAlignレイヤーは、予測された境界点に基づいて特徴をアライメントし、正確な特徴抽出を可能にする。
  • パイプライン全体がエンドツーエンドで学習可能であり、バックプロパゲーションにより検出と認識を同時に最適化できる。
  • 粗い段階から細かい段階への戦略により、境界点予測のための安定した初期化として方向付きボックスを活用し、耐性を高める。

実験結果

リサーチクエスチョン

  • RQ1境界点表現は、長方形境界ボックスに比べて、任意形状テキストの検出と認識において優れているか?
  • RQ2境界点に基づく特徴アライメントは、標準的なRoIアライメントに比べて認識性能をどのように向上させるか?
  • RQ3文字レベルアノテーションを一切使用せずに、最先端の結果を達成できるか?
  • RQ4方向付き長方形領域提案の使用は、境界点検出精度を顕著に向上させるか?
  • RQ5本手法は、曲がった、傾いた、水平なテキストを含む多様なベンチマークに一般化可能か?

主な発見

  • ICDAR2015では、検出で89.8%のFスコア、エンドツーエンドスポットで88.6%を達成し、先行研究のSOTAを上回った。
  • TotalTextでは、検出Fスコア88.9%、エンドツーエンドFスコア87.0%を達成し、曲がったテキストに対して強い性能を示した。
  • COCO-Textでは、トレーニングデータとしてCOCO-Textを使用せず、検出(Fスコア85.8%)とエンドツーエンドタスク(Fスコア65.0%)の両方でSOTAを達成した。
  • 方向付き長方形領域提案の使用により、TotalTextでは検出とエンドツーエンド性能がそれぞれ1.2%向上し、ICDAR2015では0.8%向上した。
  • アブレーションスタディにより、境界点表現がより正確な特徴抽出とより良い認識を可能にすることが確認され、特に不規則なテキストに対して顕著であった。
  • 本手法は未学習のデータセットにも良好に一般化され、縦向き、曲がった、長大なテキストインスタンスを安定して処理できるが、レアフォント、極小またはぼやけたテキストには弱い。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。