Skip to main content
QUICK REVIEW

[論文レビュー] Recurrent Calibration Network for Irregular Text Recognition

Yunze Gao, Yingying Chen|arXiv (Cornell University)|Dec 18, 2018
Handwritten Text Recognition Techniques参考文献 27被引用数 9
ひとこと要約

本稿では、歪んだテキストを段階的に補正することで文字の整合性を保ちながら、不規則なシーンテキスト認識を実現する再帰的キャリブレーションネットワーク(RCN)を提案する。この手法は、特徴点座標を繰り返し精緻化し、元の画像から直接特徴を抽出することで、歪みを段階的に補正する。この方法は、特に曲線状および多方向テキストベンチマークで最先端の性能を達成しており、CUTE80では前人最高の手法よりも最大9パーセンテージポイントの向上を達成した。

ABSTRACT

Scene text recognition has received increased attention in the research community. Text in the wild often possesses irregular arrangements, typically including perspective text, curved text, oriented text. Most existing methods are hard to work well for irregular text, especially for severely distorted text. In this paper, we propose a novel Recurrent Calibration Network (RCN) for irregular scene text recognition. The RCN progressively calibrates the irregular text to boost the recognition performance. By decomposing the calibration process into multiple steps, the irregular text can be calibrated to normal one step by step. Besides, in order to avoid the accumulation of lost information caused by inaccurate transformation, we further design a fiducial-point refinement structure to keep the integrity of text during the recurrent process. Instead of the calibrated images, the coordinates of fiducial points are tracked and refined, which implicitly models the transformation information. Based on the refined fiducial points, we estimate the transformation parameters and sample from the original image at each step. In this way, the original character information is preserved until the final transformation. Such designs lead to optimal calibration results to boost the performance of succeeding recognition. Extensive experiments on challenging datasets demonstrate the superiority of our method, especially on irregular benchmarks.

研究の動機と目的

  • 制約のない環境における著しく歪んだ不規則なテキスト、たとえば曲線状、透視的、または多方向のテキストを認識する課題に対処すること。
  • 不正確なワープによって文字情報が失われる単一ステップの空間変換の限界を克服すること。
  • 歪みを段階的に是正しつつ、元の画像の詳細を保持する再帰的キャリブレーション機構を設計すること。
  • キャリブレーションと認識をエンドツーエンドで同時に最適化することで、認識性能を向上させること。
  • 追加のアノテーションや複雑なマルチタスク学習を必要とせずに、高い精度を維持すること。

提案手法

  • RCNは再帰的構造を用いて幾何的変換を繰り返し精緻化し、連続する補正ステップ間の残差変換を推定する。
  • 変換済み画像を伝搬する代わりに、反復処理中に特徴点座標を追跡・精緻化することで、情報損失を回避する。
  • 各ステップで精緻化された特徴点を元の入力画像に戻し、元の画像から直接特徴を抽出することで、文字の詳細を保持する。
  • キャリブレーションネットワークと認識ネットワークを、共通の認識目的関数を用いて同時に学習させ、エンドツーエンド最適化を可能にする。
  • 局所化ネットワークが、直前の特徴点からの座標オフセットを予測し、暗黙的に残差空間変換をモデル化する。
  • 空間ワープにThin-Plate Spline(TPS)変換を用い、各反復ステップで精緻化された特徴点からパラメータを推定する。

実験結果

リサーチクエスチョン

  • RQ1再帰的キャリブレーション機構は、著しく歪んだ不規則なテキストの認識性能を向上させることができるか?
  • RQ2変換済み画像の代わりに特徴点座標を追跡することで、反復的キャリブレーション中の情報損失を低減できるか?
  • RQ3キャリブレーションと認識のエンドツーエンド同時最適化は、分離最適化よりも優れた性能を達成できるか?
  • RQ4本手法は、曲線状および多方向テキストにおいて、単一ステップの空間変換手法よりも優れているか?
  • RQ5境界ボックスや語彙リストなどの追加アノテーションを必要とせずに、優れた結果を達成できるか?

主な発見

  • SVTでは88.6%、IIIT5kでは94.0%、CUTE80では88.5%の精度を達成し、特に曲線状テキストにおいて顕著に優れた性能を示した。
  • CUTE80では、前人最高の手法よりも9パーセンテージポイントの向上を達成し、著しく歪んだテキストに対して強い性能を示した。
  • Total-Text(多方向)では76.3%、Total-Text(曲線状)では66.7%の精度を達成し、両方とも新しい最先端の結果となった。
  • IC03 や IC13 といった通常のベンチマークでも、RCNは競争力のある性能を示し、テキストタイプにかかわらず堅牢であることが確認された。
  • アブレーションスタディの結果、特徴点の精緻化を除去したRCN-3 w/o FP-Rでは、CUTE80で1.1%の精度低下が生じ、その重要性が裏付けられた。
  • 文字の境界ボックスや大規模語彙リストに依存する手法とは異なり、追加のパラメータやアノテーションが不要なまま高い性能を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。