Skip to main content
QUICK REVIEW

[論文レビュー] What If We Only Use Real Datasets for Scene Text Recognition? Toward Scene Text Recognition With Fewer Labels

Jeonghun Baek, Yusuke Matsui|arXiv (Cornell University)|Mar 7, 2021
Handwritten Text Recognition Techniques参考文献 72被引用数 6
ひとこと要約

この論文は、合成データセットが大規模である必要があると広く信じられている一般的な考えに挑戦し、実際の公開済みラベル付きデータのみを用いて最先端の性能を達成できることを示している。最近のベンチマークデータセットから276K件の実際のラベル付きサンプルを統合し、単純なデータ拡張と自己教師型学習を適用することで、合成データに依存せずに競争力のある精度が達成された。これは、実際のラベルのみでトレーニングされた最初の成功したSTRシステムである。

ABSTRACT

Scene text recognition (STR) task has a common practice: All state-of-the-art STR models are trained on large synthetic data. In contrast to this practice, training STR models only on fewer real labels (STR with fewer labels) is important when we have to train STR models without synthetic data: for handwritten or artistic texts that are difficult to generate synthetically and for languages other than English for which we do not always have synthetic data. However, there has been implicit common knowledge that training STR models on real data is nearly impossible because real data is insufficient. We consider that this common knowledge has obstructed the study of STR with fewer labels. In this work, we would like to reactivate STR with fewer labels by disproving the common knowledge. We consolidate recently accumulated public real data and show that we can train STR models satisfactorily only with real labeled data. Subsequently, we find simple data augmentation to fully exploit real data. Furthermore, we improve the models by collecting unlabeled data and introducing semi- and self-supervised methods. As a result, we obtain a competitive model to state-of-the-art methods. To the best of our knowledge, this is the first study that 1) shows sufficient performance by only using real labels and 2) introduces semi- and self-supervised methods into STR with fewer labels. Our code and data are available: https://github.com/ku21fan/STR-Fewer-Labels

研究の動機と目的

  • 実データが高精度なシーンテキスト認識(STR)モデルのトレーニングに不十分であるという広く信じられている考えに挑戦すること。
  • 最近の公開実データセットの蓄積により、実際のラベルのみを用いて競争力のある性能を持つSTRモデルをトレーニングできることを示すこと。
  • 限られた実ラベルデータから最大限のパフォーマンスを得るために、効果的なデータ拡張および自己教師型学習技術を開発すること。
  • 半教師ありおよび自己教師型学習フレームワークにおいて、ラベルなしデータを実データと組み合わせることの有効性を評価すること。
  • 合成データが生成しにくい分野(例:手書きや芸術的テキスト)において、ラベル数を減らした新しいSTRベンチマークを確立すること。

提案手法

  • 2011年から2019年までの実ラベル付きデータセット(SVT, IIIT5K, IC13, IC15, CUTE80, COCO-Text, RCTW, Uber-Text, ArT, LSVT, MLT19, ReCTS など)を統合し、合計276K件のサンプルを構築した。
  • 実トレーニングデータの多様性と耐性を高めるために、単純だが効果的なデータ拡張技術を適用した。
  • ラベルなしデータを収集し、半教師あり学習フレームワークで活用することで、モデルの汎化性能を向上させた。
  • 自己教師型学習を導入し、追加のラベルなしで特徴学習を強化した。
  • CRNN や TRBA といったモデルを用いて標準的なSTRベンチマークで評価し、寄与要因を分離するためのアブレーションスタディを実施した。
  • 合成データと実データの両方を用いたハイブリッド設定でもフレームワークをテストし、転送性を評価した。
Figure 1 : Accuracy vs. number of accumulated real labeled data. Every two years, public real data has been accumulated. In our experiments, we find that accuracy obtained using real data approaches that obtained using synthetic data, along with increment of real data. CRNN [ CRNN ] and TRBA [ TRBA
Figure 1 : Accuracy vs. number of accumulated real labeled data. Every two years, public real data has been accumulated. In our experiments, we find that accuracy obtained using real data approaches that obtained using synthetic data, along with increment of real data. CRNN [ CRNN ] and TRBA [ TRBA

実験結果

リサーチクエスチョン

  • RQ1合成データに依存せずに、実ラベル付きデータのみを用いて、シーンテキスト認識(STR)モデルが競争力のある性能を達成できるか?
  • RQ2大規模な合成データセットでトレーニングされたモデルと比較して、実データのみでトレーニングされたSTRモデルの性能はどの程度か?
  • RQ3限られた実ラベル付きデータでSTRパフォーマンスを向上させるために、どのデータ拡張および自己教師型学習技術が最も効果的か?
  • RQ4半教師ありおよび自己教師型学習の枠組みにおいて、ラベルなしデータを活用することでSTRモデルの性能が顕著に向上するか?
  • RQ5本研究で提案された実データのみのアプローチは、合成データが入手不能または不適切な状況でも、転送可能で有効であるか?

主な発見

  • 276K件の統合実データセットを用いることで、1600万件の合成データでトレーニングされたモデルと同等の性能が達成された。
  • データ拡張は、実データのみでトレーニングされたSTRモデルの汎化性能と耐性を顕著に向上させた。
  • 自己教師型および半教師あり学習技術は、ラベルなしデータを効果的に活用し、実データでのパフォーマンスをさらに向上させた。
  • 本研究で提案された実データのみのアプローチは、合成データに依存する最先端手法と比較しても競争力のある結果を達成した。
  • 最近のデータ蓄積を踏まえると、実データが不足しているという一般的な考えはもはや成立しなくなったことが示された。
  • ハイブリッド設定でも本手法は有効であり、実データと合成データの両方を用いた場合に強く性能を発揮した。
(a) MJ word boxes
(a) MJ word boxes

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。