Skip to main content
QUICK REVIEW

[論文レビュー] Multimodal Semi-Supervised Learning for Text Recognition

Aviad Aberdam, Roy Ganz|arXiv (Cornell University)|May 8, 2022
Handwritten Text Recognition Techniques被引用数 10
ひとこと要約

本論文は、一貫した3段階訓練パイプライン内で対照的学習と文字レベルの一貫性正則化を統合した、シーンテキスト認識のための新規マルチモーダル半教師付き学習フレームワーク、SemiMTRを提案する。ラベル付きおよびラベルなしデータを用いた視覚バックボーンの共同事前学習を対照的目的関数で行い、弱いおよび強いオーグメンテーションによるビューからの偽ラベルを用いて自己蒸留を実施することで、SemiMTRは最先端の性能を達成し、合成データのみを用いたベースラインと比較して、一般的なベンチマークで14%、非一般的なベンチマークで28%の語誤り率低減を達成した。

ABSTRACT

Until recently, the number of public real-world text images was insufficient for training scene text recognizers. Therefore, most modern training methods rely on synthetic data and operate in a fully supervised manner. Nevertheless, the amount of public real-world text images has increased significantly lately, including a great deal of unlabeled data. Leveraging these resources requires semi-supervised approaches; however, the few existing methods do not account for vision-language multimodality structure and therefore suboptimal for state-of-the-art multimodal architectures. To bridge this gap, we present semi-supervised learning for multimodal text recognizers (SemiMTR) that leverages unlabeled data at each modality training phase. Notably, our method refrains from extra training stages and maintains the current three-stage multimodal training procedure. Our algorithm starts by pretraining the vision model through a single-stage training that unifies self-supervised learning with supervised training. More specifically, we extend an existing visual representation learning algorithm and propose the first contrastive-based method for scene text recognition. After pretraining the language model on a text corpus, we fine-tune the entire network via a sequential, character-level, consistency regularization between weakly and strongly augmented views of text images. In a novel setup, consistency is enforced on each modality separately. Extensive experiments validate that our method outperforms the current training schemes and achieves state-of-the-art results on multiple scene text recognition benchmarks.

研究の動機と目的

  • シーンテキスト認識における増加する公開の現実世界のテキスト画像データセットの活用不足に取り組むこと。特に半教師付き設定において。
  • 現代のマルチモーダルアーキテクチャ(例:ABINet)と互換性を保ちつつ、ラベルなし現実世界データを効果的に活用する手法を開発すること。
  • 対照的および一貫性正則化を通じてラベルなしデータを統合することで、完全に教師ありの合成学習を上回る性能を向上させること。
  • 適切に半教師付き学習を用いて、現実世界データが合成データを上回ることを実証すること。

提案手法

  • 視覚モデルのための統合的ワンステージ事前学習を提案し、教師ありクロスエントロピー損失と対照的学習目的関数を組み合わせることで、自己教師ありと教師ありの学習を同時に可能にする。
  • 元来手書き文字認識向けに開発されたシーケンス・ツー・シーケンス対照的手法SeqCLRを、強力なトランスフォーマーベースのバックボーンと強化された色・テクスチャオーグメンテーションを用いて、シーンテキスト認識に適応・拡張する。
  • 各モダリティ(視覚、言語、統合)が自身の教師として機能し、強化されたビューにおける自己訓練用の偽ラベルを生成する、順次的・文字レベルの一貫性正則化を導入する。
  • 一貫性損失において勾配停止とハードワンホットラベルを採用し、クロスエントロピーをコア損失関数として用いることで、訓練の安定化と性能向上を図る。
  • ABINetの標準的な3段階訓練パイプライン(視覚事前学習、言語事前学習、ファインチューニング)を維持し、追加の段階や再学習ステップを追加しない。
  • モダリティ固有の偽ラベル付けを採用し、各モダリティが自身の偽ラベルを生成して学習する。最も効果的な設定は、各モダリティが自分自身を教える自己蒸留である。

実験結果

リサーチクエスチョン

  • RQ1複雑な背景や変動を伴う現実世界の画像を用いたシーンテキスト認識に、対照的学習を効果的に適用できるか?
  • RQ2対照的学習と教師あり学習を統合した統合的事前学習ステージは、分離された事前学習とファインチューニングと比較して、視覚モデルの表現力を向上させるか?
  • RQ3マルチモーダルテキスト認識において、モダリティ固有の偽ラベル付けによる自己蒸留は、クロスモダリティ蒸留よりも効果的か?
  • RQ4各モダリティごとに別々に適用する文字レベルの一貫性正則化は、半教師付きシーンテキスト認識で性能向上をもたらすか?
  • RQ5本手法を用いてラベルなし現実世界データを活用することで、完全に合成データでの学習を上回る性能が達成できるか?

主な発見

  • SemiMTRは、完全に現実世界データでの学習のみで、一般的なシーンテキストベンチマークで14%の相対的語誤り率低減、非一般的なベンチマークで28%の低減を達成し、合成データのみのベースラインを上回った。
  • 対照的学習と教師あり学習を統合した統合的事前学習ステージは、標準的な二段階アプローチを上回り、一般的なベンチマークで1.3%の絶対的精度向上を達成した。
  • 最良の一貫性正則化設定は、クロスエントロピー損失にハードワンホットラベル、勾配停止、しきい値なしを組み合わせたもので、一般的なベンチマークで92.4%の精度を達成した。
  • 自己蒸留(各モダリティが自分自身を教える)が最も高い性能を示し、視覚・言語・統合モデルは一般的なベンチマークで92.4%、非一般的なベンチマークで65.2%の精度を達成した。
  • 本手法は13のシーンテキスト認識ベンチマークのうち12で最先端の性能を達成し、多様なデータセットにわたり広範な有効性を示した。
  • 強化された色・テクスチャオーグメンテーションは、テキストインザワイルド画像における表現学習を顕著に向上させ、元のSeqCLRオーグメンテーションパイプラインと比較して1.5%の精度向上をもたらした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。