Skip to main content
QUICK REVIEW

[論文レビュー] Data augmentation with Symbolic-to-Real Image Translation GANs for Traffic Sign Recognition

Nour Soufi, Matías Valdenegro-Toro|arXiv (Cornell University)|Jul 17, 2019
Handwritten Text Recognition Techniques参考文献 14被引用数 6
ひとこと要約

本稿では、交通標識データセットの拡張を目的として、記号的表現から現実の画像への翻訳に条件付きGAN(pix2pix)を用いる手法を提案している。これにより、円形標識の分類精度が92.1%から94.0%へ1.9%向上し、三角形標識では93.8%から95.3%へ1.5%向上した。しかし、精度向上の程度は限定的であり、コントラスト変化や位置ずれといった従来の拡張手法が、それぞれ95.5%および96.7%の精度を達成しており、GANベースの拡張手法を上回っている。これは、この分野においてGANが万能ではないことを示唆している。

ABSTRACT

Traffic sign recognition is an important component of many advanced driving assistance systems, and it is required for full autonomous driving. Computational performance is usually the bottleneck in using large scale neural networks for this purpose. SqueezeNet is a good candidate for efficient image classification of traffic signs, but in our experiments it does not reach high accuracy, and we believe this is due to lack of data, requiring data augmentation. Generative adversarial networks can learn the high dimensional distribution of empirical data, allowing the generation of new data points. In this paper we apply pix2pix GANs architecture to generate new traffic sign images and evaluate the use of these images in data augmentation. We were motivated to use pix2pix to translate symbolic sign images to real ones due to the mode collapse in Conditional GANs. Through our experiments we found that data augmentation using GAN can increase classification accuracy for circular traffic signs from 92.1% to 94.0%, and for triangular traffic signs from 93.8% to 95.3%, producing an overall improvement of 2%. However some traditional augmentation techniques can outperform GAN data augmentation, for example contrast variation in circular traffic signs (95.5%) and displacement on triangular traffic signs (96.7 %). Our negative results shows that while GANs can be naively used for data augmentation, they are not always the best choice, depending on the problem and variability in the data.

研究の動機と目的

  • SqueezeNetを用いた交通標識認識で、訓練データ不足に起因する分類精度の低さを是正すること。
  • 生成的敵対ネットワーク(GAN)を交通標識画像のデータ拡張手法として検討すること。
  • pix2pixを用いて記号的表現から現実の画像への翻訳を行うことで、条件付きGANにおけるモード崩壊を是正すること。
  • 分類性能の観点から、GANベースの拡張手法と従来のデータ拡張技術を比較すること。
  • GANで生成された画像が、実世界の交通標識データセットにおけるモデルの汎化性能を実際に向上させられるかどうかを評価すること。

提案手法

  • 記号的(ベクトルベースの)交通標識表現から現実的でリアルな画像への画像翻訳を目的とした、pix2pix GANアーキテクチャを改変した。
  • 生成器が記号的入力画像を写真的にリアルな出力にマッピングするように学習する条件付きGANを訓練した。また、識別器は本物の画像と生成された画像を区別する。
  • 局所的な画像パッチを評価することで、より良いテクスチャやディテールの生成を実現するため、PatchGAN識別器を採用した。
  • 生成された画像をSqueezeNetを用いた交通標識分類の拡張学習データとして活用した。
  • 生成器および識別器の各訓練イテレーション数、エンコーダ/デコーダ層の数といったハイパーパrameterを最適化した。
  • 円形および三角形の交通標識サブセットにおける分類性能を評価するため、標準的な指標(正解率およびバランス正解率)を用いた。

実験結果

リサーチクエスチョン

  • RQ1pix2pix GANは、データ拡張を目的として、記号的表現から現実の交通標識画像を効果的に生成できるか?
  • RQ2ベースラインおよび従来の拡張手法と比較して、GANベースのデータ拡張はSqueezeNetの交通標識認識タスクにおける分類精度を向上させるか?
  • RQ3コントラスト変化や位置ずれといった確立されたデータ拡張技術と比較して、GANベースの拡張手法の性能はいかがなっているか?
  • RQ4なぜこの特定のタスクにおいて、従来の拡張手法がGANベースの拡張を上回っているのか?
  • RQ5訓練データの変動が少ない状況において、条件付きGANをデータ拡張に用いる際の限界は何か?

主な発見

  • GANベースのデータ拡張により、円形交通標識の分類精度が92.1%から94.0%へ1.9ポイント向上した。
  • 三角形交通標識では、93.8%から95.3%へ1.5ポイント向上した。
  • 従来のコントラスト変化拡張では、円形標識で95.5%の精度を達成し、GANベースの手法を上回った。
  • 位置ずれ拡張では、三角形標識で96.7%の精度を記録し、GANによる95.3%を大きく上回った。
  • 本研究では、GANが常にデータ拡張の最適な選択肢ではないことが判明した。特に、単純な従来手法がより優れた結果をもたらす場合がある。
  • 画像翻訳は成功したが、生成画像は手動で設計された拡張法ほど汎化性能が高くならず、GANが複雑な現実世界のデータ変動をモデル化する能力に限界があることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。