[論文レビュー] Learning to Read by Spelling: Towards Unsupervised Text Recognition
本稿では、教師なしのテキスト認識手法を提案する。この手法は、画像から予測された文字列を、ペairされないコーパスからの統計的に妥当な文字列とアラインメントさせることで、教師ありデータを一切用いずに、敵対的訓練により文字の識別を暗黙的に学習する。実際の歴史的書籍スキャンにおいて、96.2%の文字精度と84.8%の単語精度を達成し、非一様な空白間隔に強く耐性があり、一般化性能に優れていることを示している。
This work presents a method for visual text recognition without using any paired supervisory data. We formulate the text recognition task as one of aligning the conditional distribution of strings predicted from given text images, with lexically valid strings sampled from target corpora. This enables fully automated, and unsupervised learning from just line-level text-images, and unpaired text-string samples, obviating the need for large aligned datasets. We present detailed analysis for various aspects of the proposed method, namely - (1) impact of the length of training sequences on convergence, (2) relation between character frequencies and the order in which they are learnt, (3) generalisation ability of our recognition network to inputs of arbitrary lengths, and (4) impact of varying the text corpus on recognition accuracy. Finally, we demonstrate excellent text recognition accuracy on both synthetically generated text images, and scanned images of real printed books, using no labelled training examples.
研究の動機と目的
- 教師ありデータ収集の高コストを克服するため、ペア化された画像-テキストアノテーションを一切用いずに動作するテキスト認識システムの開発。
- 正しいスペルの学習(予測文字列を妥当な言語統計と一致させること)が、暗黙的に正確なテキスト認識を可能にするかの検証。
- 本手法の任意長の入力や、異なるテキストコーパス(例:『戦争と平和』など関連のない分野)への一般化性能の評価。
- 非一様な空白間隔や可変フォント幅を示す歴史的プリント済書籍など、現実的で困難なデータに対する強力な性能の提示。
提案手法
- 本手法は、画像から予測された文字列の条件付き分布を、ターゲットコーパスからサンプリングされた妥当な文字列の分布とアラインメントさせることで、テキスト認識を定式化する。敵対的訓練を用いる。
- 完全畳み込みネットワークが入力画像から文字列を予測し、ディスクラミネーターが予測文字列が実際の言語の統計的性質(例:n-gram、頻度)と一致することを保証する。
- ジェネレーター(認識ネットワーク)がディスクラミネーターが本物の妥当なテキストと区別できない文字列を生成できるように、GANに類似した目的関数を用いてエンドツーエンドで訓練する。
- 実スキャンされた書籍における非一様な空白間隔や可変幅フォントに対処するため、認識ネットワークの最終層にスイップRNNを追加し、畳み込み特徴量に対するリマインダー更新を提供する。
- 訓練プロセスでは、ペア化されていないデータ(画像ラインペアと別個のペア化されていないコーパスからのテキスト文字列)のみを用い、アラインメントや手動アノテーションの必要性を排除する。
- 文字の識別は言語制約を通じて暗黙的に学習され、頻度の高い文字が早く学習され、頻度の低い文字(例:'z')は最後に学習される。
実験結果
リサーチクエスチョン
- RQ1妥当なテキストの統計的性質に依存するだけで、ペア化された画像-テキスト訓練データが一切不要なテキスト認識が可能か?
- RQ2訓練シーケンスの長さが収束性および認識性能に与える影響は?
- RQ3コーパス内の文字頻度が、文字学習の順序と品質に与える影響は?
- RQ41つの長さのテキストで訓練されたモデルが、著しく異なる長さの入力に一般化可能か?
- RQ5特に画像内容とは関連のないコーパス(例:トールストイの『戦争と平和』)を選択した場合、認識精度にどのような影響があるか?
主な発見
- 合成テキスト画像で、ペア化されていない画像とテキストデータでのみ学習した後、99%の文字精度と95%の単語精度を達成した。
- 非一様な空白間隔を示す実スキャン書籍画像において、スイップRNNを強化したモデルは、単語精度を45.0%から84.8%、文字精度を85.6%から96.2%に向上させた。
- 文字学習の順序は文字頻度と強く相関しており、共通語「to」や「it」は早く学習され、レア文字「v」や「w」は後で学習される。
- 任意長の入力に優れた一般化性能を示し、3~48文字のシーケンスにおいても、24文字のシーケンスでのみ学習した場合でも高い性能を維持した。
- 画像内容とは関連のないコーパス(例:WMTニュースクラウド)を用いた場合、単語精度は92.53%に低下したが、関連のあるコーパス(WMTニュースクラウド)を用いた場合、ほぼ最適な性能(約95%)を維持した。
- 誤りマトリクスから、一貫して誤認識されるのは低頻度文字(例:'z')のみであり、稀な文字の認識が、教師なし設定下でも依然として課題であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。