Skip to main content
QUICK REVIEW

[論文レビュー] Verisimilar Image Synthesis for Accurate Detection and Recognition of Texts in Scenes

Fangneng Zhan, Shijian Lu|arXiv (Cornell University)|Jul 9, 2018
Handwritten Text Recognition Techniques参考文献 49被引用数 11
ひとこと要約

本稿では、テキスト検出および認識のための堅牢なディープラーニングモデルを訓練するための現実的でアノテート済みのシーンテキスト画像を生成する、信ぴょう性の高い画像合成技術を提案する。意味的整合性、視覚的顕著性、および適応的テキスト外観モデルを活用することで、500万枚の高品質な画像が合成され、複数のベンチマークデータセットにおいて最先端の性能が顕著に向上した。

ABSTRACT

The requirement of large amounts of annotated images has become one grand challenge while training deep neural network models for various visual detection and recognition tasks. This paper presents a novel image synthesis technique that aims to generate a large amount of annotated scene text images for training accurate and robust scene text detection and recognition models. The proposed technique consists of three innovative designs. First, it realizes "semantic coherent" synthesis by embedding texts at semantically sensible regions within the background image, where the semantic coherence is achieved by leveraging the semantic annotations of objects and image regions that have been created in the prior semantic segmentation research. Second, it exploits visual saliency to determine the embedding locations within each semantic sensible region, which coincides with the fact that texts are often placed around homogeneous regions for better visibility in scenes. Third, it designs an adaptive text appearance model that determines the color and brightness of embedded texts by learning from the feature of real scene text images adaptively. The proposed technique has been evaluated over five public datasets and the experiments show its superior performance in training accurate and robust scene text detection and recognition models.

研究の動機と目的

  • シーンテキストタスクにおけるディープニューラルネットワークの訓練データが限られているというボトル neck を解決すること。
  • 大規模で現実的かつ正確にアノテートされたシーンテキスト画像を生成し、堅牢な検出および認識モデルの訓練を可能にすること。
  • 現実世界のテキスト配置および外観を模倣する画像の合成により、モデルの汎化性能を向上させること。
  • 手作業による高価なアノテーションに依存するのを減らし、知的画像合成によるデータ拡張を可能にすること。
  • 合成データを用いて、シーンテキスト検出および認識において最先端の性能を達成すること。

提案手法

  • 事前にあるセマンティックセグメンテーションアノテーションを用いて、意味的に整合性のある領域にテキストを埋め込むことで、文脈的な妥当性を保証する。
  • 視覚的顕著性マップを用いて、セマンティックゾーン内の最適で均一な領域を特定し、テキストの可視性と現実性を向上させる。
  • ローカルな背景特徴に基づいてテキストの色および明るさを適応的に調整し、実際のシーンテキスト統計から学習することで、視覚的一致性を向上させる。
  • セマンティックマップと顕著性マップを組み合わせることで、背景画像内の正確で自然な見た目のテキスト埋め込み位置をガイドする。
  • 多様な背景画像に3要素フレームワークを適用することで、500万枚の合成シーンテキスト画像を生成する。
  • 実データに合成画像を追加して拡張し、検出および認識モデルを訓練することで、性能向上の評価を行う。

実験結果

リサーチクエスチョン

  • RQ1テキスト配置における意味的整合性は、合成されたシーンテキスト画像の現実性および有用性を向上させるか?
  • RQ2視覚的顕著性を組み込むことで、合成画像内の埋め込みテキストの自然さおよび検出可能性が向上するか?
  • RQ3実際のシーンテキスト特徴から学ぶ適応的外観モデルは、合成テキストの視覚的忠実度を向上させられるか?
  • RQ4本手法で生成された合成データは、公開ベンチマークでの検出および認識性能をどの程度向上させるか?
  • RQ5本手法は、従来のデータ拡張技術と比較して、モデルの精度および汎化性能において優れているか?

主な発見

  • 提案手法は、シーンテキスト検出および認識のための5つの公開ベンチマークデータセットで最先端の性能を達成した。
  • ICDAR2013データセットでは、実データのみで学習したベースラインの認識精度(CRW)が31.2%であったのを、500万枚の合成画像で学習したことで87.1%まで向上した。
  • IIIT5Kでは、語彙なしで79.3%、1,000語の語彙サイズで95.3%に達し、ベースラインを著しく上回った。
  • SVTでは、50語の語彙サイズで合成データで学習したモデルが96.7%のCRWを達成し、強い汎化性能を示した。
  • JaderbergらやGuptaらの合成データで学習したモデルと比較して、本手法の合成データ(CRNN (Real+Ours 5M))で学習したモデルは、すべてのデータセットで優れた性能を示した。
  • ICDAR2013では50語の語彙サイズで98.1%の認識精度を達成し、800万枚の合成画像を用いた先行SOTAモデルを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。