Skip to main content
QUICK REVIEW

[論文レビュー] Training Deep Networks with Synthetic Data: Bridging the Reality Gap by Domain Randomization

Jonathan Tremblay, Aayush Prakash|arXiv (Cornell University)|Apr 17, 2018
Advanced Neural Network Applications被引用数 7
ひとこと要約

本論文は、照明、テクスチャ、オブジェクトの姿勢などのシミュレーションパラメータをランダムに摺り替えることで、現実世界とのギャップを埋めるためにドメインランダマイゼーション(DR)を提案する。この手法により、合成データのみを用いて深層ニューラルネットワークを訓練し、KITTIデータセットで最先端の性能を達成した。これは、フォトリアルな合成データで訓練されたモデルを上回り、微調整後には実データのみで訓練したモデルでさえも上回った。

ABSTRACT

We present a system for training deep neural networks for object detection using synthetic images. To handle the variability in real-world data, the system relies upon the technique of domain randomization, in which the parameters of the simulator$-$such as lighting, pose, object textures, etc.$-$are randomized in non-realistic ways to force the neural network to learn the essential features of the object of interest. We explore the importance of these parameters, showing that it is possible to produce a network with compelling performance using only non-artistically-generated synthetic data. With additional fine-tuning on real data, the network yields better performance than using real data alone. This result opens up the possibility of using inexpensive synthetic data for training neural networks while avoiding the need to collect large amounts of hand-annotated real-world data or to generate high-fidelity synthetic worlds$-$both of which remain bottlenecks for many applications. The approach is evaluated on bounding box detection of cars on the KITTI dataset.

研究の動機と目的

  • コンピュータビジョン分野における深層学習モデルの学習に向けた高コストなアノテーションと限られた実世界データの課題に対処する。
  • 合成データと実世界データの間の現実ギャップを、ランダマイゼーションによる合成データの耐性向上によって克服する。
  • 微調整を実世界データで行った場合に、ドメインランダマイゼーションを施した合成データが、実データや高精細なフォトリアル合成データセットを上回ることを実証する。
  • ドメインランダマイゼーションのパラメータやデータ拡張戦略の違いが検出性能に与える影響を調査する。

提案手法

  • 照明、オブジェクトのテクスチャ、ポーズ、背景要素などのシミュレータパラメータをランダムに摺り替えることで、合成画像生成にドメインランダマイゼーションを適用する。
  • 検出性能と耐性の向上を目的として、シーン内をランダムに動く「フライングディストラクタ(飛行する干渉要因)」を導入する。
  • 完全に合成データ(DR)のみを用いて、オブジェクト検出モデル(例:Faster R-CNN、R-FCN)を初期学習段階で実世界データを一切使用せずに訓練する。
  • 実世界データ(例:KITTI)の少量を用いて、事前に学習したモデルを微調整し、実世界の分布シフトに適応させる。
  • 一般化性能のさらなる向上を図るため、トレーニング中にランダムな色ずれ、スケーリング、クロッピングなどのデータ拡張戦略を用いる。
  • 一般化性能と転移可能性を評価するため、異なる初期化戦略(ImageNet、COCO)と学習プロトコルを比較する。

実験結果

リサーチクエスチョン

  • RQ1ドメインランダマイゼーションを施した合成データを用いた学習が、実世界のオブジェクト検出ベンチマークで競争力のある性能を達成できるか?
  • RQ2合成DRデータで学習した後、実データで微調整した場合、実データのみで学習した場合と比較して検出精度にどのような影響を与えるか?
  • RQ3照明、テクスチャ、ディストラクタなどのドメインランダマイゼーションパラメータのうち、検出性能に最も顕著な影響を与えるのはどれか?
  • RQ4最終的なモデル精度の観点から、DRベースの合成データは、高精細なフォトリアル合成データセットと比較してどうなるか?

主な発見

  • COCOの重みで初期化したFaster R-CNN検出器は、ドメインランダマイズド合成データのみで学習した結果、KITTIデータセットでAP 83.7を達成し、フォトリアルなVirtual KITTIデータセットで学習した場合(AP: 79.7)を上回った。
  • DRで学習したモデルを実KITTIデータで微調整した結果、実データのみで学習した場合よりも高い性能を示し、合成データから実世界への転移の有効性を示した。
  • 合成DRデータでの学習中に初期層を凍結すると、性能が最大13.5%低下した。これは、最適な適応のためには完全な微調整が必要であることを示している。
  • ImageNetで事前学習した場合、約10,000枚のトレーニング画像で性能が飽和し、事前学習なしでは約50,000枚で飽和した。これは、DRを用いる場合、大量のデータが必ずしも必須でないことを示唆している。
  • 「フライングディストラクタ」の導入により検出精度が向上した。これは、ドメインランダマイゼーションにおける動的シーン変化の重要性を示している。
  • COCOで事前学習(車両が含まれる)した場合、ランダム初期化よりも性能が著しく向上した。さらに、DRによりその恩恵が強化された。これは、DRが異種ドメイン間でのより良い特徴学習を可能にしていることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。