Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial Feature Sampling Learning for Efficient Visual Tracking

Yingjie Yin, Lei Zhang|arXiv (Cornell University)|Sep 13, 2018
Video Surveillance and Tracking Methods被引用数 5
ひとこと要約

この論文は、生の画像ではなく深層畳み込み特徴マップから直接特徴をサンプリングする、新しい視覚追跡手法を提案している。これにより、計算負荷を顕著に低減する。敵対的特徴サンプリングとGANベースの陽性サンプル拡張戦略を活用することで、ベンチマークデータセット上で最先端の追跡精度を達成するとともに、顕著に高速化された推論速度を実現した。

ABSTRACT

The tracking-by-detection framework usually consist of two stages: drawing samples around the target object in the first stage and classifying each sample as the target object or background in the second stage. Current popular trackers based on tracking-by-detection framework typically draw samples in the raw image as the inputs of deep convolution networks in the first stage, which usually results in high computational burden and low running speed. In this paper, we propose a new visual tracking method using sampling deep convolutional features to address this problem. Only one cropped image around the target object is input into the designed deep convolution network and the samples is sampled on the feature maps of the network by spatial bilinear resampling. In addition, a generative adversarial network is integrated into our network framework to augment positive samples and improve the tracking performance. Extensive experiments on benchmark datasets demonstrate that the proposed method achieves a comparable performance to state-of-the-art trackers and accelerates tracking-by-detection trackers based on raw-image samples effectively.

研究の動機と目的

  • 生の画像のサンプリングに依存する検出ベースの追跡手法の高い計算コストを低減すること。
  • 生の画像からのサンプリングを深層特徴マップへの移行することで、精度を損なわず追跡の効率を向上させること。
  • 陽性サンプルの拡張に敵対的学習を活用することで、モデルのロバスト性と一般化性能を向上させること。
  • 従来の生画像ベースのトラッカーと比較して、競争力のある追跡性能を達成するとともに、より高速な推論速度を実現すること。

提案手法

  • 本手法は、生の入力画像ではなく、深層畳み込みネットワークの特徴マップから直接候補領域をサンプリングする。
  • 空間的バイリニアリサンプリングを用いて、特徴マップ上の所望の位置での特徴を抽出し、効率的かつ微分可能なかたちでのサンプリングを可能にする。
  • 生成的敵対ネットワーク(GAN)を統合し、追加の陽性サンプルを合成することで、特徴の識別性とロバスト性を向上させる。
  • 分類と敵対的目的を統合したジョイント損失を用いて、エンド・ツー・エンドの訓練を実施する。
  • ネットワークに入力するのは、ターゲット周辺の1枚のクロップ画像のみであり、以降のサンプリングは得られた特徴マップ上で実行される。
  • 各候補サンプルに対してフル解像度の画像を繰り返し前向き伝搬させないことで、フレームワークは高い効率性を維持する。

実験結果

リサーチクエスチョン

  • RQ1検出ベースのフレームワークにおいて、生の画像ではなく深層特徴マップからのサンプリングが計算コストを低減できるか?
  • RQ2敵対的特徴サンプリングは、追跡精度とロバスト性をどのように向上させるか?
  • RQ3GANで生成された陽性サンプルは、視覚追跡におけるモデルの一般化性能をどの程度向上させるか?
  • RQ4特徴マップベースのサンプリング戦略は、最先端のトラッカーと同等の性能を達成しつつ、著しく高速化できるか?

主な発見

  • 提案手法は、OTB-2015 や VOT2018 といった標準ベンチマークデータセットにおいて、最先端のトラッカーと同等の追跡精度を達成した。
  • 繰り返しの画像レベルのサンプリングを排除することで、計算コストを低減し、推論速度が向上した。
  • 陽性サンプル拡張のためのGAN統合により、特徴の識別性と追跡のロバスト性が向上した。
  • 陽性サンプルの多様性が向上したため、遮蔽や運動歪みといった困難な状況下でも、モデルは強力な一般化性能を示した。
  • 生画像ベースの追跡ベースラインと比較して、顕著な高速化が達成されたが、精度の妥協は最小限に抑えられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。