Skip to main content
QUICK REVIEW

[論文レビュー] Traditional Chinese Synthetic Datasets Verified with Labeled Data for Scene Text Recognition

Yi‐Chang Chen, Yu‐Chuan Chang|arXiv (Cornell University)|Nov 26, 2021
Handwritten Text Recognition Techniques参考文献 13被引用数 4
ひとこと要約

本論文は、繁体字のシーンテキスト認識(STR)のための合成データ生成フレームワークを導入し、フォント、背景、テキストプロパティのバリエーションを用いて2000万枚以上の多様な合成画像を生成した。新たに作成されたTC-STR 7,000語のベンチマークで評価したところ、合成データで事前学習し、実データで微調整したモデルは89.64%の正確性を達成し、人為的ラベル付きデータを最小限に抑えた状態で顕著な性能向上を示した。

ABSTRACT

Scene text recognition (STR) has been widely studied in academia and industry. Training a text recognition model often requires a large amount of labeled data, but data labeling can be difficult, expensive, or time-consuming, especially for Traditional Chinese text recognition. To the best of our knowledge, public datasets for Traditional Chinese text recognition are lacking. This paper presents a framework for a Traditional Chinese synthetic data engine which aims to improve text recognition model performance. We generated over 20 million synthetic data and collected over 7,000 manually labeled data TC-STR 7k-word as the benchmark. Experimental results show that a text recognition model can achieve much better accuracy either by training from scratch with our generated synthetic data or by further fine-tuning with TC-STR 7k-word.

研究の動機と目的

  • 繁体字のシーンテキスト認識(STR)のための公開で高品質なデータセットが不足している問題に対処すること。
  • 現実世界のテキストの多様性を模倣するスケーラブルな合成データ生成フレームワークを開発し、低コストで大量のトレーニングデータを提供すること。
  • 信頼できるSTRモデルの評価のため、手動でアノテートされた実世界のベンチマークデータセット(TC-STR 7,000語)を作成すること。
  • 特に背景とフォントのバリエーションが、モデルの汎化性能と正確性に与える影響を評価すること。
  • 合成データで事前学習した後、限られた実データで微調整することで、実データのみで訓練する場合よりも優れた性能を達成できることを示すこと。

提案手法

  • 合成データエンジンは、整理された辞書およびウィキペディアのタイトルから単語をサンプリングし、文字間隔をランダムに挿入し、175種類の異なるフォントを用いた多様なフォントレンダリングを含む、段階的なパイプラインでシーンテキスト画像を生成する。
  • テキストレンダリングには、可変なフォントサイズ、色、ストローク効果、ずれ、歪み、ノイズを組み込み、現実世界のばらつきを再現する。
  • 背景には、単純な固体色と、実際の画像から抽出された複雑で野生的な背景を組み合わせ、リアルさと多様性を向上させる。
  • モデルアーキテクチャは、TPS変換、特徴抽出のためのResNet、シーケンスモデリングのためのBiLSTM、シーケンス予測のためのCTCを用いる。
  • アブレーションスタディーでは、背景、フォント、シーン、単語の多様性がモデル性能に与える寄与を分離して評価する。
  • 微調整は、合成データで事前学習したモデルと、実データのTC-STR 7,000語データセットのサブセットを用い、データ拡張を併用して実施する。

実験結果

リサーチクエスチョン

  • RQ1合成データ生成フレームワークは、実世界のラベル付きデータを最小限に抑えた状態で、繁体字のシーンテキスト認識モデルの性能を顕著に向上させることができるか?
  • RQ2背景、フォント、テキストの歪み、単語の多様性の変化が、STRモデルの汎化性能と正確性にどのように影響するか?
  • RQ3合成データで事前学習した後、実データで微調整することで、実データのみで訓練する場合よりも優れた性能を達成できるか?
  • RQ4合成データに複雑で野生的な背景を含めることで、単純な背景と比較してモデルのロバストネスがどの程度向上するか?
  • RQ5合成データは、繁体字のSTRにおける高価な人為的アノテーションの必要性をどの程度低減できるか?

主な発見

  • 2,000万枚の合成画像で事前学習し、TC-STR 7,000語データセットの一部で微調整したモデルは、89.64%の正確性を達成し、実データのみで訓練したモデルを上回った。
  • 合成データでの事前学習のみで、TC-STR-テストセットで83.51%の正確性を達成した。これは、合成画像の質とリアルさが確認されたことを示している。
  • 背景の多様性が性能に最も大きな影響を与えた。単純な背景でのみ学習したモデルは顕著に低い正確性を示した。
  • フォントの多様性は不可欠であった。1つのフォント(Source Han Sans)のみを使用した場合、モデルの汎化性能と正確性が著しく低下した。
  • 単語の多様性も顕著に性能に影響した。語彙辞書の90%を除外すると、認識正確性が著しく低下した。
  • 微調整段階でのデータ拡張は僅かな改善しかもたらさなかった。これは、合成データがすでに十分なばらつきを捉えており、追加の拡張が不要である可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。