[論文レビュー] Masked Vision-Language Transformers for Scene Text Recognition
本稿では、視覚変換器エンコーダとマルチモーダル変換器デコーダを用いて、明示的および暗黙的な言語的意味を同時に学習する2段階のSTRモデルであるMasked Vision-Language Transformers (MVLT) を提案する。視覚的パッチとマスクされたテキストトークンの両方を再構築する二重マスキング戦略で事前学習することで、完全にマスクされた入力からの学習も可能となり、複数のベンチマークで最先端の性能を達成し、CUTEでは先行手法を最大2.1%上回った。
Scene text recognition (STR) enables computers to recognize and read the text in various real-world scenes. Recent STR models benefit from taking linguistic information in addition to visual cues into consideration. We propose a novel Masked Vision-Language Transformers (MVLT) to capture both the explicit and the implicit linguistic information. Our encoder is a Vision Transformer, and our decoder is a multi-modal Transformer. MVLT is trained in two stages: in the first stage, we design a STR-tailored pretraining method based on a masking strategy; in the second stage, we fine-tune our model and adopt an iterative correction method to improve the performance. MVLT attains superior results compared to state-of-the-art STR models on several benchmarks. Our code and model are available at https://github.com/onealwj/MVLT.
研究の動機と目的
- 劣悪な照明、遮蔽、歪みの下でのシーンテキスト認識(STR)の課題に対処するため、言語的意味を視覚モデルに統合する。
- 従来の言語に配慮したSTRモデルが明示的言語モデルまたは暗黙的な視覚的手がかりのいずれかに依存しているが、両方を統合していないという限界を克服する。
- 事前学習中に明示的(単語レベル)および暗黙的(文脈的)言語的知識を統合する統一フレームワークを構築する。
- 事前学習中にラベルなしの現実世界データを活用し、微調整時に反復的補正を適用することで、実用的応用性を向上させる。
提案手法
- 2段階のトレーニングパイプラインを提案:(1) 新たなマスキング戦略を用いた事前学習で視覚的および言語的意味を学習し、(2) 反復的補正を用いた微調整。
- 画像パッチからの視覚的特徴を抽出するために、ビジョン変換器(ViT)をエンコーダとして使用する。
- 2つのサブデコーダを備えたマルチモーダル変換器デコーダを設計:1つは文字レベルトークンをマスクして予測する(明示的意味)、もう1つはすべてのテキストをマスクして、視覚的手がかりのみから暗黙的意味を学習する。
- 事前学習中に2つのサブデコーダ間でパラメータを共有することで、効率性と特徴の整合性を向上させる。
- MAEにインspiredされたマスキング事前学習目的を導入:視覚的パッチとテキストトークンがマスクされ、視覚的および言語的損失を同時に最適化する。
- 微調整時に反復的補正を適用:モデルは画像と過去の予測を入力として複数回の順伝播を繰り返し、予測を改善する。
実験結果
リサーチクエスチョン
- RQ1明示的および暗黙的な言語的意味を同時に学習することで、厳しい現実世界条件下でのシーンテキスト認識が向上するか?
- RQ2視覚的パッチとテキストトークンの両方をマスクする二重マスキング戦略による事前学習は、モデルの汎化性および耐性を向上させるか?
- RQ3ラベルなしの現実世界データの使用は、実用的状況下でのSTR性能向上にどの程度有効か?
- RQ4推論時に反復的補正を適用することで、不規則または劣化したテキストの認識精度がどの程度向上するか?
- RQ5完全にマスクされたテキスト入力からの学習(暗黙的意味)は、明示的な単語レベルの手がかりに依存するのと比べて、より有益であるか?
主な発見
- MVLTは全評価ベンチマークで最先端の性能を達成し、SVT、IIIT、IC15、SVTP、CUTEではそれぞれABINetを1.2%、0.6%、1.2%、1.6%、2.1%上回った。
- MVLT*(事前学習時にラベルなしの現実世界データを活用)は、特に不規則なテキストに対してさらなる向上を示し、現実世界での耐性が向上していることが確認された。
- アブレーションスタディにより、明示的および暗黙的意味の両方を学習することが不可欠であることが確認された。両方を排除すると精度が低下し、特に暗黙的学習の寄与が顕著であった。
- 反復的補正は性能向上に顕著な効果を示し、特に訓練時に明示的なテキスト監督が用いられた場合に顕著であった。
- 事前学習段階では、モデルが視覚的パッチとマスクされたテキストトークンの両方を再構築できており、意味的な視覚的・言語的表現を学習していることが示された。
- 可視化結果から、微調整後、モデルが遮蔽、ぼやけ、歪み、複雑なフォントのテキストを効果的に処理できていることが確認され、優れた汎化性能が示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。