Skip to main content
QUICK REVIEW

[論文レビュー] Visual Compiler: Synthesizing a Scene-Specific Pedestrian Detector and Pose Estimator

Namhoon Lee, Xinshuo Weng|arXiv (Cornell University)|Dec 15, 2016
Video Surveillance and Tracking Methods参考文献 29被引用数 9
ひとこと要約

本論文では、1枚のシーン画像、カメラパrameter、幾何的レイアウトのみを入力として、シーン固有の歩行者検出器およびポーズ推定器を生成するVisual Compilerを紹介する。物理的に正確で幾何的に整合性のある合成歩行者を、正確なアノテーションとともにレンダリングすることで、空間的に変化する完全畳み込みニューラルネットワーク(ScenePoseNet)を訓練する。このモデルは、合成データのみで訓練されたにもかかわらず、合成データおよび実データの両方のテストデータにおいて、実データで訓練された最先端のモデルを上回る性能を示す。

ABSTRACT

We introduce the concept of a Visual Compiler that generates a scene specific pedestrian detector and pose estimator without any pedestrian observations. Given a single image and auxiliary scene information in the form of camera parameters and geometric layout of the scene, the Visual Compiler first infers geometrically and photometrically accurate images of humans in that scene through the use of computer graphics rendering. Using these renders we learn a scene-and-region specific spatially-varying fully convolutional neural network, for simultaneous detection, pose estimation and segmentation of pedestrians. We demonstrate that when real human annotated data is scarce or non-existent, our data generation strategy can provide an excellent solution for bootstrapping human detection and pose estimation. Experimental results show that our approach outperforms off-the-shelf state-of-the-art pedestrian detectors and pose estimators that are trained on real data.

研究の動機と目的

  • 実データとしての人物アノテーションが入手できない新しい監視環境への、正確な歩行者検出およびポーズ推定の導入を課題とする。
  • トレーニングに実データに依存しないようにし、モデルトレーニングに高精細で物理的に根拠を持つ合成データを生成する。
  • 高レベルのシーン仕様から、自動的にシーン固有の視覚プログラム(深層ニューラルネットワーク)をコンパイルするシステムを開発する。
  • 幾何的および光度的に正確な合成データが、実データで訓練されたモデルを上回る性能を示すことを実証する。
  • 手動でのデータ収集を伴わず、新環境に高精度な歩行者分析システムを迅速に展開可能にする。

提案手法

  • Visual Compilerは、シーン記述(1枚の画像、カメラパrameter、粗い3次元レイアウト)を入力として、グラフィックスレンダリングエンジンを駆動する。
  • シーン内の歩行者を物理的に根拠を持つ、幾何的に正確な合成レンダリングを生成し、ポーズ、衣服、3次元位置を変化させる。
  • ノイズのない正確なアノテーション(検出、ボディパーツ位置、インスタンスセグメンテーションマスク)を含む。
  • 空間的に変化する完全畳み込みニューラルネットワーク(ScenePoseNet)を、この合成データ上でエンドツーエンドに訓練し、歩行者検出、ポーズ推定、セグメンテーションを統合して実行する。
  • 特徴学習とトレーニング安定性の向上のため、スタックされた空間的信念(SB)ユニットとスキップ接続を採用する。
  • トレーニングは完全に合成データのみで実施され、トレーニング段階で実データは一切使用せず、実世界のベンチマークで評価される。

実験結果

リサーチクエスチョン

  • RQ1シーンの幾何構造とカメラパrameterから生成された合成データのみで、シーン固有の歩行者検出器およびポーズ推定器を効果的に訓練できるか?
  • RQ2幾何的および光度的に正確な合成データは、実データで訓練されたモデルと比較して、検出およびポーズ推定の精度で優れているか?
  • RQ3歩行者のポーズと向きのサンプリングに事前知識を用いることで、モデル性能にどのような影響があるか?
  • RQ4スタックされたSBユニットやスキップ接続といったアーキテクチャ的要素が、トレーニングおよび推論に与える影響は何か?
  • RQ5合成データで訓練された1つの統合モデルは、ファインチューニングなしで実世界のテストデータに十分に一般化できるか?

主な発見

  • ScenePoseNetは、合成データのみで訓練されたにもかかわらず、PETS2006およびTowncenterデータセットの両方において、すべての実データで訓練されたベースラインを上回る性能を示した。
  • PETS2006データセットでは平均平均精度(mAP)が85.7%、Towncenterデータセットでは87.3%を達成し、最先端の実データモデルを上回った。
  • 歩行者のポーズと向きのサンプリングに事前知識を用いることで、一様サンプリングよりも性能が向上し、50,000枚のトレーニングレンダリングで最適な性能が達成された。
  • 2番目の空間的信念(SB)ユニットを追加すると性能が著しく向上したが、3番目のユニットはわずかな改善にとどまった。
  • スキップ接続はトレーニング安定性にとって不可欠であり、それらを含まないモデルは収束しなかった。
  • ScenePoseNetは1フレームあたり0.18秒で処理可能であり、最速のベースライン組み合わせ(Faster R-CNN + CPM)の0.37秒よりも100%以上高速であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。