Skip to main content
QUICK REVIEW

[論文レビュー] SynthText3D: Synthesizing Scene Text Images from 3D Virtual Worlds

Minghui Liao, Boyu Song|arXiv (Cornell University)|Jul 13, 2019
Handwritten Text Recognition Techniques参考文献 47被引用数 6
ひとこと要約

本稿では、編集可能な照明、視点、隠蔽を備えた3D仮想世界をレンダリングすることで、現実的なシーンテキスト画像を生成する新規手法、SynthText3Dを提案する。従来の方法が2D背景にテキストを貼り付けるのに対し、SynthText3Dはテキストとシーンを統合された3Dシーンとしてレンダリングすることで、優れた視覚的リアリズムを実現し、はるかに少ない学習データで、シーンテキスト検出ベンチマークで最先端の性能を達成した。

ABSTRACT

With the development of deep neural networks, the demand for a significant amount of annotated training data becomes the performance bottlenecks in many fields of research and applications. Image synthesis can generate annotated images automatically and freely, which gains increasing attention recently. In this paper, we propose to synthesize scene text images from the 3D virtual worlds, where the precise descriptions of scenes, editable illumination/visibility, and realistic physics are provided. Different from the previous methods which paste the rendered text on static 2D images, our method can render the 3D virtual scene and text instances as an entirety. In this way, real-world variations, including complex perspective transformations, various illuminations, and occlusions, can be realized in our synthesized scene text images. Moreover, the same text instances with various viewpoints can be produced by randomly moving and rotating the virtual camera, which acts as human eyes. The experiments on the standard scene text detection benchmarks using the generated synthetic data demonstrate the effectiveness and superiority of the proposed method. The code and synthetic data is available at: https://github.com/MhLiao/SynthText3D

研究の動機と目的

  • 限られた、アノテートに費用がかかる現実世界のシーンテキスト学習データの課題に対処すること。
  • 合成データと現実世界のシーンテキスト画像との間の視覚的リアリズムのギャップを克服すること。
  • 正確な幾何学的および意味的属性を備えた高品質な合成シーンテキストデータを生成すること。
  • 視覚的歪み、隠蔽、照明変化などの多様で現実的なバリエーションを生成すること。
  • 3Dで合成されたデータが、既存の2Dベースの合成データセットを上回るか、補完的に機能することを実証すること。

提案手法

  • さまざまなフォントのテキストインスタンスが、意味的および幾何学的に適切な位置に3D仮想世界に埋め込まれる。
  • グラフィックスエンジンを用いて、テキストと背景を含む3Dシーン全体をレンダリングすることで、現実的な照明と可視性を保証する。
  • 仮想カメラを再配置・再方向づけ、多様な視点を生成し、人間の視覚的認識を模倣する。
  • 表面法線マップを3Dエンジンから直接抽出し、正確なテキスト配置を支援する。
  • 30種類の異なる3D仮想環境を活用して、多様なシーンコンテキストを生成する。
  • SynthTextと公平な比較を可能にするために、一貫したテキスト生成技術(例:コーパス、色調パレット)を用いて合成データを生成する。

実験結果

リサーチクエスチョン

  • RQ13D仮想世界のレンダリングは、2D背景ベースの合成に比べて、より現実的なシーンテキスト画像を生成できるか?
  • RQ23Dで合成されたデータは、既存の合成データセットに比べて、シーンテキスト検出性能をどの程度向上できるか?
  • RQ33D環境の多様性が、合成データで訓練されたモデルの汎化性能や性能に与える影響はどの程度か?
  • RQ43D仮想世界から生成された合成データは、現実世界のデータと補完的に機能し、シーンテキスト検出におけるドメインギャップを軽減できるか?
  • RQ53Dで生成されたデータを用いることで、はるかに少ない学習画像で最先端の性能を達成できるか?

主な発見

  • ICDAR 2015、ICDAR 2013、MLTベンチマークにおいて、それぞれF-measureでSynthTextを20.0%、10.8%、11.1%上回った。
  • 10のシーンから10,000枚の画像しか使用しなくても、SynthTextの800,000枚のデータセットを上回る性能を達成した。
  • SynthText3Dデータと現実世界データを組み合わせることで、ICDAR 2015でF-measureが1.4%向上し、事前学習における有効性が実証された。
  • 10のシーンから5,000枚の画像と5,000枚のVISD画像を用いた学習で最高の性能が得られ、3Dと2Dの合成データの相乗効果が示された。
  • 30の仮想環境の数を増やすことで顕著な性能向上が得られ、3Dデータの多様性にまだ潜在的な可能性が残っていることが示された。
  • 完全な3Dシーンレンダリングのおかげで、2D貼り付けベースの手法とは異なり、現実的な隠蔽、視覚的歪み、照明変化を生成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。