Skip to main content
QUICK REVIEW

[論文レビュー] Lucid Data Dreaming for Multiple Object Tracking

Anna Khoreva, Rodrigo Benenson|arXiv (Cornell University)|Mar 28, 2017
Video Surveillance and Tracking Methods参考文献 42被引用数 31
ひとこと要約

本論文では、1つのアノテート済み最初のフレームからドメイン内合成動画フレームを生成する訓練戦略「Lucid Data Dreaming」を提案する。これにより、従来手法よりも20倍〜100倍少ないアノテート済みデータで、高精度な複数対象追跡が可能になる。妥当な将来フレームを合成することで、ImageNetの事前学習を用いない状態でも、外観および運動ベースのモデルを効果的に学習可能となり、3つのベンチマークで最先端の結果を達成する。

ABSTRACT

Convolutional networks reach top quality in pixel-level object tracking but require a large amount of training data (1k ~ 10k) to deliver such results. We propose a new training strategy which achieves state-of-the-art results across three evaluation datasets while using 20x ~ 100x less annotated data than competing methods. Instead of using large training sets hoping to generalize across domains, we generate in-domain training data using the provided annotation on the first frame of each video to synthesize ("lucid dream") plausible future video frames. In-domain per-video training data allows us to train high quality appearance- and motion-based models, as well as tune the post-processing stage. This approach allows to reach competitive results even when training from only a single annotated frame, without ImageNet pre-training. Our results indicate that using a larger training set is not automatically better, and that for the tracking task a smaller training set that is closer to the target domain is more effective. This changes the mindset regarding how many training samples and general "objectness" knowledge are required for the object tracking task.

研究の動機と目的

  • 複数対象追跡のための大量アノテートデータセットへの依存を低減すること。
  • 現在の手法が高性能を発揮するために数千フレームものアノテートデータを必要としているという制限を克服すること。
  • 一般事前学習や大規模データに依存せずに、最小限のドメイン固有の学習データで追跡性能を向上させること。
  • ドメイン固有のデータ拡張が、一般ドメインの多様性に比べて追跡タスクで優れるかどうかを調査すること。

提案手法

  • 最初のフレームのアノテーションを条件付き事前分布として用い、各動画の妥当な将来フレームを合成する。
  • 初期アノテーションからの時間的整合性および物体の運動事前分布を活用して、ドメイン固有の学習データを生成する。
  • 合成データ上で外観および運動モデルをエンドツーエンドに訓練し、ImageNet事前学習なしでも有効な特徴抽出を可能にする。
  • 同じ合成データを用いて後処理モジュールを微調整し、追跡のロバスト性を向上させる。
  • 各動画に対して唯一のアノテート済みフレームを監視信号として用い、全動画のアノテーションを回避する。
  • 物体の同一性と運動の妥当性を保持するデータ拡張技術をフレーム生成中に適用する。

実験結果

リサーチクエスチョン

  • RQ11つの動画あたり1つのアノテート済みフレームのみで、高品質な複数対象追跡が達成可能か?
  • RQ2ドメイン固有のデータ生成は、一般ドメインデータに比べて追跡性能で優れるか?
  • RQ3最先端の追跡性能を達成するには大規模なアノテートデータが必要か?
  • RQ4合成データ生成により、追跡モデルにおけるImageNet事前学習への依存を軽減できるか?
  • RQ5ドメイン特化のデータ拡張は、多様ではあるがドメイン外のデータに比べて、より良い一般化をもたらすか?

主な発見

  • 提案手法は、1動画あたり1つのアノテート済みフレームのみを用いても、3つの標準的な複数対象追跡ベンチマークで最先端の性能を達成した。
  • ドメイン固有のデータを用いた場合、データ量が少なくても、大規模だがドメイン外のデータセットを用いた場合よりも性能が顕著に向上した。
  • ImageNet事前学習なしでも競争力のある結果を達成した。これは、ドメイン固有データが特徴抽出に有効であることを示している。
  • 競合手法よりも20倍〜100倍少ないアノテートフレームを用いても、優れたもしくは同等の追跡精度を達成した。
  • データ量が最も多いことが常に良いとは限らないという仮定に疑問を呈し、ターゲットドメインへのデータの関連性が量よりも重要であることを示した。
  • 1フレームからの合成データ生成により、後処理部のチューニングが効果的に行え、追跡のロバスト性がさらに向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。