Skip to main content
QUICK REVIEW

[論文レビュー] Expecting the Unexpected: Training Detectors for Unusual Pedestrians with Adversarial Imposters

Shiyu Huang, Deva Ramanan|arXiv (Cornell University)|Mar 18, 2017
Human Pose and Action Recognition参考文献 2被引用数 4
ひとこと要約

本論文は、ゲームエンジンを用いて合成された「敵対的偽物」(実際のものに似たが、まれな歩行者シナリオ、たとえば子供が遊んでいる、またはスケートボードに乗っている人など)を生成するGANにインspiredされたフレームワークを提案する。このフレームワークでは、識別器を訓練して実際のデータと合成データを区別させることで、歩行者検出器の性能を、まれで危険なシナリオにおいて顕著に向上させる。実際のデータと高品質な合成偽物のバランスの取れた混合データで検出器をファインチューニングすることで、Novel Precarious Pedestrian データセットで最先端の結果を達成した。

ABSTRACT

As autonomous vehicles become an every-day reality, high-accuracy pedestrian detection is of paramount practical importance. Pedestrian detection is a highly researched topic with mature methods, but most datasets focus on common scenes of people engaged in typical walking poses on sidewalks. But performance is most crucial for dangerous scenarios, such as children playing in the street or people using bicycles/skateboards in unexpected ways. Such "in-the-tail" data is notoriously hard to observe, making both training and testing difficult. To analyze this problem, we have collected a novel annotated dataset of dangerous scenarios called the Precarious Pedestrian dataset. Even given a dedicated collection effort, it is relatively small by contemporary standards (around 1000 images). To allow for large-scale data-driven learning, we explore the use of synthetic data generated by a game engine. A significant challenge is selected the right "priors" or parameters for synthesis: we would like realistic data with poses and object configurations that mimic true Precarious Pedestrians. Inspired by Generative Adversarial Networks (GANs), we generate a massive amount of synthetic data and train a discriminative classifier to select a realistic subset, which we deem the Adversarial Imposters. We demonstrate that this simple pipeline allows one to synthesize realistic training data by making use of rendering/animation engines within a GAN framework. Interestingly, we also demonstrate that such data can be used to rank algorithms, suggesting that Adversarial Imposters can also be used for "in-the-tail" validation at test-time, a notoriously difficult challenge for real-world deployment.

研究の動機と目的

  • 既存のデータセットに実際的でまれな歩行者シナリオが不足していることにより、自動運転車両向けの頑健な歩行者検出器のトレーニングと評価が妨げられているという問題に対処すること。
  • まれで危険な歩行者行動の統計的および視覚的特性を捉える高精細な合成データをスケーラブルに生成する方法を開発すること。
  • 識別分類器を用いて、最も現実的な合成サンプル(「敵対的偽物」)のみを選別することで、合成データから実世界への効果的な転移学習を可能にすること。
  • 合成された敵対的偽物が、トレーニングデータとしてだけでなく、実際のデータが乏しい「末尾の」シナリオにおける検出器性能の評価用テストセットとしても信頼できるものであるかを検証すること。

提案手法

  • シーンパラメータ(例:ボディポーズ、オブジェクトの配置)から合成画像を生成するレンダリングパイプラインを用い、ゲームエンジンの物理法則およびライティングの忠実度を活用する。
  • 生成対抗フレームワークを適用し、生成器をレンダリングエンジンそのものに固定し、潜在空間を最適化して識別器を欺く画像を生成する。
  • 識別器は、Precarious Pedestrian データセットの実画像と合成画像を分類するように訓練され、識別器を最も混乱させる(つまり、最も現実的に見える)合成画像が「敵対的偽物」として選別される。
  • 各ピクセルごとに、歩行者検出の密度マップと回帰されたバウンディングボックスを出力する、新規の検出器 RPN+ を提案する。これにより、まれで標準でない歩行者ポーズの検出性能が向上する。
  • 最終的な検出器は、実データと敵対的偽物の組み合わせでファインチューニングされる。アブレーションスタディにより、偽物セットのサイズが実トレーニングセットサイズと等しい場合に最良の性能が得られることを示した。
  • 識別器のトレーニングプロセスを監視し、複数のバージョンを用いて、トレーニングの異なる段階で偽物を選別することで、時間の経過とともに合成データの品質が向上することを実証した。

実験結果

リサーチクエスチョン

  • RQ1ゲームエンジンから生成された合成データに、敵対的トレーニングを適用することで、子供が遊んでいる、またはスケートボードに乗っているなど、まれな歩行者行動の現実的で多様な例を生成できるか?
  • RQ2実データと敵対的偽物のバランスの取れた混合データで歩行者検出器をファインチューニングすることで、実データのみでトレーニングする場合と比較して、まれで危険な歩行者シナリオにおける性能が向上するか?
  • RQ3敵対的偽物は、実際のテストデータが乏しい「末尾の」シナリオにおける検出器の頑健性を評価する信頼できる合成テストセットとして機能できるか?
  • RQ4敵対的偽物セットのサイズと識別器のトレーニング段階は、最終的な検出器性能にどのように影響するか?

主な発見

  • 実データと敵対的偽物でファインチューニングされた RPN+ 検出器は、10⁻¹ の誤検出率におけるミス率が 42.47% にまで低下し、標準的なファインチューニング(6% の改善)および実データでのみのトレーニング(24% の改善)を上回った。
  • 敵対的偽物の数が実トレーニングセットサイズ(500枚)とほぼ等しい場合に最適な性能が得られた。これは、バランスの取れたデータ分布の重要性を示している。
  • 識別器がトレーニングを経るにつれて精度が向上するにつれ、最終的な検出器の性能も向上した。これは、より高品質な合成データが、より良い一般化性能をもたらすことを示している。
  • 実際のテストデータと合成された敵対的偽物テストデータの両方で、検出器の順位が同一であった。これは、合成データが実際のまれなシナリオのテストデータに信頼性を持って代用可能であることを示唆している。
  • 本手法により、敵対的精錬を経た合成データが、合成と現実世界の歩行者検出シナリオの間のドメインギャップを効果的に埋め合わせられることを示した。
  • 敵対的偽物でトレーニングされた RPN+ モデルは Caltech データセットでは性能を発揮しなかった。これは、スケール、アスペクト比、シーンの分布の違いによるドメインシフトの影響を示しており、ドメイン固有のデータの重要性を強調している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。