Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial Generation of Training Examples for Vehicle License Plate Recognition.

Xinlong Wang, Mingyu You|arXiv (Cornell University)|Jul 11, 2017
Vehicle License Plate Recognition参考文献 22被引用数 8
ひとこと要約

本稿では、深層学習モデルの学習用に合成されたナンバープレート画像を生成するGANベースのパイプラインを提案する。この手法は、GANジェネレータとDCNN-BRNN-LSTMアーキテクチャを組み合わせており、中程度の実データを用いた強力なベースラインと比較して認識精度を7.5%向上させた。また、モバイルおよび組み込みデバイスでの効率的な推論を可能にする軽量な畳み込みRNNを導入している。

ABSTRACT

Generative Adversarial Networks (GAN) have attracted much research attention recently, leading to impressive results for natural image generation. However, to date little success was observed in using GAN generated images for improving classification tasks. Here we attempt to explore, in the context of car license plate recognition, whether it is possible to generate synthetic training data using GAN to improve recognition accuracy. With a carefully-designed pipeline, we show that the answer is affirmative. First, a large-scale image set is generated using the generator of GAN, without manual annotation. Then, these images are fed to a deep convolutional neural network (DCNN) followed by a bidirectional recurrent neural network (BRNN) with long short-term memory (LSTM), which performs the feature learning and sequence labelling. Finally, the pre-trained model is fine-tuned on real images. Our experimental results on a few data sets demonstrate the effectiveness of using GAN images: an improvement of 7.5% over a strong baseline with moderate-sized real data being available. We show that the proposed framework achieves competitive recognition accuracy on challenging test datasets. We also leverage the depthwise separate convolution to construct a lightweight convolutional RNN, which is about half size and 2x faster on CPU. Combining this framework and the proposed pipeline, we make progress in performing accurate recognition on mobile and embedded devices.

研究の動機と目的

  • GANで生成された合成画像が、自動車のナンバープレート認識性能を向上させるかどうかを調査すること。
  • 実世界の訓練データが限られているという課題に対処するため、大規模で多様な合成データを生成すること。
  • モバイルおよび組み込みデバイスへのデプロイメントに適した軽量なディープラーニングアーキテクチャの開発すること。
  • GANベースの事前学習後に実データで微調整することで、優れた認識精度が得られることを示すこと。

提案手法

  • 教師なしの手動アノテーションを伴わない、大規模で現実的である合成ナンバープレート画像を生成するための生成対抗ネットワーク(GAN)を訓練する。
  • 生成された画像を用いて、深層畳み込みニューラルネットワーク(DCNN)に続く双方向リカレントニューラルネットワークと長短期記憶(BRNN-LSTM)を組み合わせたシーケンスラベル付け用の深層ニューラルネットワークを事前学習する。
  • 実際のナンバープレート画像の小規模なデータセットを用いて、事前学習モデルを微調整し、実世界の変動に適応させる。
  • 深度分離畳み込みを用いたアーキテクチャを採用して、軽量な畳み込みRNNを構築し、CPU上でのモデルサイズを半分に削減し、推論速度を2倍に向上させる。
  • GANで生成されたデータとエンドツーエンド学習を統合することで、困難なテストセットにおける頑健性と一般化性能を向上させる。
  • 性能向上と効率改善の有効性を検証するため、複数のデータセットでパイプラインを評価する。

実験結果

リサーチクエスチョン

  • RQ1GANで生成された合成訓練データは、自動車のナンバープレート認識モデルの精度を向上させることができるか?
  • RQ2GANで生成されたデータとDCNN-BRNN-LSTMアーキテクチャの組み合わせは、シーケンスベースの認識タスクを効果的に処理できるか?
  • RQ3GAN事前学習後に実データで微調整することで、実世界のテストセットにおけるモデル性能がどの程度向上するか?
  • RQ4軽量な畳み込みRNNアーキテクチャは、モデルサイズと推論時間を削減しながらも、高い精度を維持できるか?

主な発見

  • 提案されたGANベースのデータ生成パイプラインは、中程度の実訓練データが利用可能な状況で、強力なベースラインと比較して認識精度を7.5%向上させた。
  • モデルは困難なテストデータセットにおいても競争力のある性能を示し、実世界の変動に対して頑健であることを確認した。
  • 深度分離畳み込みの統合により、モデルサイズは約50%削減され、CPU上での推論速度は2倍に向上した。
  • GAN事前学習済みモデルを実画像で微調整することで、一般化性能と認識性能が顕著に向上した。
  • 本フレームワークは、モバイルおよび組み込みデバイスへのデプロイメントに適した正確で効率的なナンバープレート認識を可能にした。
  • GANを用いて生成された合成データの使用は、データが限られた状況下での下流分類タスクの改善に有効であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。