[論文レビュー] From Two to One: A New Scene Text Recognizer with Visual Language Modeling Network
本稿では、トレーニング中にビジョンモデルに内在的な言語能力を付与することにより、視覚的および言語的理解を統合する新しいシーンテキスト認識モデル、VisionLANを提案する。マスクド・ランゲージ・アウェア・モジュールを用いて文字の遮蔽をシミュレートし、コンテキストを活用するためのビジョンリーズニングモジュールを導入することで、外部言語モデルを不要とし、ワンステップで効率的かつ頑健なテキスト認識を実現。39%高速な推論を達成し、最先端の精度を実現した。
In this paper, we abandon the dominant complex language model and rethink the linguistic learning process in the scene text recognition. Different from previous methods considering the visual and linguistic information in two separate structures, we propose a Visual Language Modeling Network (VisionLAN), which views the visual and linguistic information as a union by directly enduing the vision model with language capability. Specially, we introduce the text recognition of character-wise occluded feature maps in the training stage. Such operation guides the vision model to use not only the visual texture of characters, but also the linguistic information in visual context for recognition when the visual cues are confused (e.g. occlusion, noise, etc.). As the linguistic information is acquired along with visual features without the need of extra language model, VisionLAN significantly improves the speed by 39% and adaptively considers the linguistic information to enhance the visual features for accurate recognition. Furthermore, an Occlusion Scene Text (OST) dataset is proposed to evaluate the performance on the case of missing character-wise visual cues. The state of-the-art results on several benchmarks prove our effectiveness. Code and dataset are available at https://github.com/wangyuxin87/VisionLAN.
研究の動機と目的
- 従来の2段階型シーンテキスト認識手法における、視覚的および言語的情報の非効率な統合と低効率な処理を是正すること。
- トレーニング段階でビジョンモデルが言語的コンテキストを自律的に学習・利用できるようにすることにより、別個の言語モデルへの依存を低減すること。
- 遮蔽、ノイズ、ぼやけなど、困難な条件下でのテキスト認識の頑健性を向上させること。
- 文字単位の視覚的手がかりが欠落する状況を評価するための新しいベンチマーク、OSTを提案すること。
- 言語モデリングをビジョンバックボーンに直接統合することで、高精度かつ高速なワンステップ認識パイプラインを実現すること。
提案手法
- ビジョンモデルがトレーニング段階で言語的コンテキストを推論できるようにする統合アーキテクチャ、Visual Language Modeling Network (VisionLAN) を導入する。
- マスクド・ランゲージ・アウェア・モジュール (MLM) を採用し、正解の文字インデックスに基づいて文字単位のマスクマップを生成することで、トレーニング時に視覚的遮蔽をシミュレートする。
- ビジョンリーズニングモジュール (VRM) を用いて、遮蔽された視覚特徴からテキストを予測させることで、視覚空間内での言語的依存関係を直接学習可能にする。
- 視覚的ヒントが劣化した場合に、言語的コンテキストを適応的に特徴強化に活用できるようにビジョンモデルを訓練するが、推論時には外部言語モデルを一切必要としない。
- 弱い教師付き補完的学習を活用し、位置とコンテキストに基づいて、欠落した文字ヒントを局所化する妥当なマスクマップを生成する。
- テスト時にはMLMを削除し、強化された特徴を持つビジョンモデルのみを用いるため、言語モデリングに追加の計算コストが一切かからない。
実験結果
リサーチクエスチョン
- RQ1ビジョンモデルを、視覚的劣化下でも言語的コンテキストを自律的に学習・利用できるようにトレーニングすることは可能か?
- RQ2単一のネットワークアーキテクチャ内で視覚的および言語的モデリングを統合することで、2段階アプローチと比較して計算コストを削減しつつ精度を向上させられるか?
- RQ3文字単位の視覚的特徴が欠落または破損している状況下でも、提案手法は効果的にテキスト認識が可能か?
- RQ4長文やローマ字以外の言語(例:中国語)に対しても、困難な条件下で一般化可能か?
- RQ5視覚的特徴空間内で言語的コンテキストをエンドツーエンドで学習することで、モデルの性能はどの程度向上するか?
主な発見
- VisionLANは、単一のネットワーク内で視覚的および言語的情報を統合することで、ベースラインモデルと比較して平均で7.3%の精度向上を達成した。
- 外部言語モデルの必要性がなくなるため、従来の2段階アプローチと比較して推論速度が39%向上した。
- TRW15長文中国語ベンチマークでは88.7%の精度を達成し、以前のSOTA(SRN)を3.2%上回った。
- 提案されたOcclusion Scene Text (OST) データセットでは、文字単位の視覚的ヒント欠落に対する優れた頑健性を示した。
- 定性的な結果から、VisionLANは「e」と「f」のような紛らわしい文字を正しく識別し、言語的コンテキストを活用して背景の干渉を抑制していることが確認された。
- マスクド・ランゲージ・アウェア・モジュールは、文字単位の視覚的ヒントを適切に局所化でき、歪みや繰り返しのある文字に対しても一般化性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。