Skip to main content
QUICK REVIEW

[論文レビュー] Text Perceptron: Towards End-to-End Arbitrary-Shaped Text Spotting

Qiao Liang, Sanli Tang|arXiv (Cornell University)|Feb 17, 2020
Handwritten Text Recognition Techniques参考文献 40被引用数 4
ひとこと要約

Text Perceptron は、分類ベースの検出器と微分可能 Shape Transform Module (STM) を統合することで、任意形状のテキストスポットティングのエンド・ツー・エンドで学習可能なフレームワークを提案する。STM は、薄板スプラインに基づく補正に適応的に最適化される特徴点を動的に生成する。本手法は、Total-Text や CTW1500 といった不規則なテキストベンチマークで最先端の性能を達成し、誤差信号のバックプロパゲーションにより検出と認識の共同最適化を可能にすることで、従来のパイプライン型または非エンド・ツー・エンド手法を著しく上回る。

ABSTRACT

Many approaches have recently been proposed to detect irregular scene text and achieved promising results. However, their localization results may not well satisfy the following text recognition part mainly because of two reasons: 1) recognizing arbitrary shaped text is still a challenging task, and 2) prevalent non-trainable pipeline strategies between text detection and text recognition will lead to suboptimal performances. To handle this incompatibility problem, in this paper we propose an end-to-end trainable text spotting approach named Text Perceptron. Concretely, Text Perceptron first employs an efficient segmentation-based text detector that learns the latent text reading order and boundary information. Then a novel Shape Transform Module (abbr. STM) is designed to transform the detected feature regions into regular morphologies without extra parameters. It unites text detection and the following recognition part into a whole framework, and helps the whole network achieve global optimization. Experiments show that our method achieves competitive performance on two standard text benchmarks, i.e., ICDAR 2013 and ICDAR 2015, and also obviously outperforms existing methods on irregular text benchmarks SCUT-CTW1500 and Total-Text.

研究の動機と目的

  • 従来のパイプライン型テキスト検出と認識の間にある不適合性を解消し、不規則なテキストにおけるエンド・ツー・エンド最適化と耐障害性を向上させること。
  • 固定された補正手法や微分不能な特徴点生成の制限を克服し、曲がったまたは多方向のシーンテキストを効果的に処理すること。
  • 認識フィードバックに基づいて特徴点を動的に調整することで、検出と認識を統合的に最適化する一貫性のある学習可能なフレームワークを設計すること。
  • 分類ベースの検出器を用いて読み順序と境界構造を明示的にモデル化することで、任意形状のテキストにおける認識精度を向上させること。
  • 外部の補正ネットワークの必要性を排除し、エンド・ツー・エンド学習プロセスに補正を統合することで計算コストを低減すること。

提案手法

  • 各画素を中心、先頭、末尾、上部/下部境界の4領域に分類する分類ベースのテキスト検出器を設計し、学習された読み順序に従ってテキストインスタンスを検出可能にする。
  • Shape Transform Module (STM) は、微分可能な薄板スプライン (TPS) を用いてテキスト境界上に特徴点を生成・最適化し、不規則なテキストを規則的で補正された形状に変換する。
  • 認識ヘッドからのバックプロパゲーションにより特徴点が動的に調整され、検出と認識の両コンponentのエンド・ツー・エンド最適化が可能になる。
  • 補正された特徴量から文字列を生成するためのシーケンスベースの認識ヘッド(例:CRNN)を用いる。
  • システム全体がエンド・ツー・エンドで学習され、認識からの誤差信号が検出と特徴点位置の最適化にフィードバックされる。
  • 特徴点数は4〜18の可変範囲をサポートし、不規則なベンチマークでは10〜14点で性能が安定化することが判明した。

実験結果

リサーチクエスチョン

  • RQ1微分可能でエンド・ツー・エンドのフレームワークは、パイプライン型手法の制限を克服し、任意形状テキストの検出と認識を共同で最適化できるか?
  • RQ2特徴点の数が、曲がったまたは多方向のテキストにおける補正と認識性能に与える影響は何か?
  • RQ3構造的境界分類を備えた分類ベースの検出器は、密接に配置されたまたは重なったテキストインスタンスの検出を改善できるか?
  • RQ4学習可能な特徴点を備えた微分可能な形状変換モジュールは、非微分可能または固定幾何形状の補正手法を上回れるか?
  • RQ5認識誤差のバックプロパゲーションを伴うエンド・ツー・エンド学習は、従来の2段階学習に比べて検出と補正の性能を向上させるか?

主な発見

  • ICDAR 2015 では18個の特徴点を用いて検出 F スコア 87.1、Total-Text では85.3 を達成し、規則的・不規則的テキストの両方で優れた一般化性能を示した。
  • 不規則なベンチマーク CTW1500 では18個の特徴点を用いてエンド・ツー・エンド F スコア 84.5 を達成し、従来の最先端手法を著しく上回った。
  • Total-Text および CTW1500 における性能は特徴点数の増加に伴い向上し、10〜14点で安定化した。これは、より複雑な形状には高精度な特徴点表現が必要であることを示している。
  • 4個の特徴点でも ICDAR 2015 で F スコア 87.1 を達成し、高数の特徴点と比較して最小限の性能低下を示した。これは、規則的テキストには十分な表現能力があることを示している。
  • 故障解析の結果、重なったテキストや縦向きテキストの認識が依然として困難であることが判明。主な要因はトレーニングデータにおける表現不足と認識モデルの曖昧さに起因する。
  • 可視化結果から、モデルが学習された特徴点を用いて読み順序を効果的に捉え、曲がりくねった、透視的、縦向きのテキストを規則的な形状に補正していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。