Skip to main content
QUICK REVIEW

[論文レビュー] Convolutional Character Networks

Linjie Xing, Zhi Tian|arXiv (Cornell University)|Oct 17, 2019
Handwritten Text Recognition Techniques参考文献 37被引用数 9
ひとこと要約

この論文では、文字を基本単位として用い、1回の順方向伝搬でテキストインスタンス検出と文字認識を同時に実行する、一括処理型のエンドツーエンド畳み込みニューラルネットワーク(CharNet)を提案する。RNNベースの認識を軽量なCNNブランチに置き換え、ドメイン一般化のための反復的で文字検出を導入することで、ICDAR 2015およびTotal-Textで最先端の性能を達成し、エンドツーエンド認識のF-measureをそれぞれ71.08%(汎用語彙を用いる場合)および69.23%に向上させた。

ABSTRACT

Recent progress has been made on developing a unified framework for joint text detection and recognition in natural images, but existing joint models were mostly built on two-stage framework by involving ROI pooling, which can degrade the performance on recognition task. In this work, we propose convolutional character networks, referred as CharNet, which is an one-stage model that can process two tasks simultaneously in one pass. CharNet directly outputs bounding boxes of words and characters, with corresponding character labels. We utilize character as basic element, allowing us to overcome the main difficulty of existing approaches that attempted to optimize text detection jointly with a RNN-based recognition branch. In addition, we develop an iterative character detection approach able to transform the ability of character detection learned from synthetic data to real-world images. These technical improvements result in a simple, compact, yet powerful one-stage model that works reliably on multi-orientation and curved text. We evaluate CharNet on three standard benchmarks, where it consistently outperforms the state-of-the-art approaches [25, 24] by a large margin, e.g., with improvements of 65.33%->71.08% (with generic lexicon) on ICDAR 2015, and 54.0%->69.23% on Total-Text, on end-to-end text recognition. Code is available at: https://github.com/MalongTech/research-charnet.

研究の動機と目的

  • 2段階フレームワークの限界、特にROIプーリングとRNNベースの認識による性能低下を解消すること。
  • 2段階モデルにおけるRNNベースの認識と検出の同時最適化の難しさを克服し、複雑なトレーニング方式と大量のデータを必要としないこと。
  • ワードと文字の境界ボックスと対応するラベルを直接出力する統合的で一括処理型のアーキテクチャを開発し、トレーニング効率と性能を向上させること。
  • 反復的検出戦略を用いて、合成データから実画像への文字検出の有効な転送を可能にし、曲がった文字列や多方向テキストに対する耐性を高めること。
  • 語彙に依存せず、実世界での導入に適した、コンactで軽量なモデルを構築すること。

提案手法

  • 1回の順方向伝搬でテキストインスタンス検出と文字認識を同時に実行する一括処理型の完全畳み込みネットワーク(CharNet)を提案する。
  • RNNの代わりに軽量なCNNブランチを用いた文字レベル認識ブランチを導入し、トレーニングの簡素化とモデル複雑度の低減を実現する。
  • 文字を検出と認識の基本単位として採用することで、中国語のような言語への一般化性が向上し、曲がったまたは多方向のテキストでも性能が向上する。
  • 合成データから実画像への知識転送を促進するため、反復的で文字検出戦略を採用し、ドメイン一般化性を向上させる。
  • マルチスケール推論を適用することで、特に困難なテキストインスタンスの検出と認識精度を向上させる。
  • 標準的なテキスト検出フレームワーク(例:ResNetやHourglassバックボーンに基づくもの)に文字認識ブランチをシームレスに統合し、エンドツーエンド学習を可能にする。

実験結果

リサーチクエスチョン

  • RQ12段階のRNN統合フレームワークと比較して、一括処理型のCNNベースのモデルが、エンドツーエンドのテキスト検出と認識において優れた性能を達成できるか?
  • RQ2ワードではなく文字を基本単位として用いることで、中国語や曲がったテキストなど、特に多様な言語や形状に一般化性が向上するか?
  • RQ3検出と同時に学習する際、軽量なCNNベースの文字認識ブランチが、RNNベースの代替手法を上回り、モデル複雑度を低減できるか?
  • RQ4反復的リファインメントを用いて、合成データで学習した文字検出モデルを、実画像に効果的に転送できるか?
  • RQ5本手法は、曲がったテキストや多方向テキストを含む、困難なベンチマークにおいて、最先端の手法と比較してどの程度の性能を示すか?

主な発見

  • ICDAR 2015でエンドツーエンド認識のF-measureが71.08%に達し、汎用語彙を用いた場合に、先行研究の65.33%から向上した、新たな最先端の結果を達成した。
  • Total-Textでは、エンドツーエンド認識のF-measureが69.23%に達し、前回の最良手法比で15.2%の向上を示し、曲がったテキストの性能が顕著に向上した。
  • Hourglass-88バックボーンとマルチスケール推論を用いることで、ICDAR 2015で単一スケールの最先端性能を達成し、Mask TextSpotter や FOTS と比較して、すべての評価指標で優れた結果を示した。
  • 語彙なしで60.72%のE2E認識F-measureを達成し、FOTSが汎用語彙を用いた場合と同等の性能を示し、優れたゼロショット一般化能力を示した。
  • 同じバックボーン(Hourglass-57)を用いた場合、CharNetはFOTSより6.12%高い性能を示したが、認識ブランチのパラメータ数は1.19MとFOTSの6.31Mに比べて著しく少ない。
  • マルチスケール推論を用いた場合、ICDAR 2017 MLTでテキスト検出のF-measureが86.5%に達し、以前の最先端手法を大きく上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。