Skip to main content
QUICK REVIEW

[論文レビュー] Recurrent Filter Learning for Visual Tracking

Tianyu Yang, Antoni B. Chan|arXiv (Cornell University)|Aug 13, 2017
Video Surveillance and Tracking Methods参考文献 39被引用数 10
ひとこと要約

本論文では、オンライン微調整を必要とせずリアルタイムにオブジェクト固有のフィルタを生成する、新しい視覚追跡フレームワークである再帰的フィルタ学習(RFL)を提案する。再帰的ネットワークを用いてターゲットの例示を処理することで空間的構造を保持するため、RFLはOTB100およびVOT2016/2017ベンチマークで最先端の性能を達成し、外見の変化に対しても高い速度と耐性を示す。

ABSTRACT

Recently using convolutional neural networks (CNNs) has gained popularity in visual tracking, due to its robust feature representation of images. Recent methods perform online tracking by fine-tuning a pre-trained CNN model to the specific target object using stochastic gradient descent (SGD) back-propagation, which is usually time-consuming. In this paper, we propose a recurrent filter generation methods for visual tracking. We directly feed the target's image patch to a recurrent neural network (RNN) to estimate an object-specific filter for tracking. As the video sequence is a spatiotemporal data, we extend the matrix multiplications of the fully-connected layers of the RNN to a convolution operation on feature maps, which preserves the target's spatial structure and also is memory-efficient. The tracked object in the subsequent frames will be fed into the RNN to adapt the generated filters to appearance variations of the target. Note that once the off-line training process of our network is finished, there is no need to fine-tune the network for specific objects, which makes our approach more efficient than methods that use iterative fine-tuning to online learn the target. Extensive experiments conducted on widely used benchmarks, OTB and VOT, demonstrate encouraging results compared to other recent methods.

研究の動機と目的

  • 推論時にSGDベースの適応を必要としないことで、CNNベースのトラッカーにおけるオンライン微調整の非効率性を解消する。
  • 照明の変化、遮蔽、高速移動などの外見の変化に対する耐性を、一般的な視覚追跡において向上させる。
  • RNNにおける特徴エンコーディング中にターゲットオブジェクトの空間的構造を保持するため、ベクトル化された入力を特徴マップ処理に置き換える。
  • LSTMメモリユニットにおける完全畳み込み構造を活用することで、シフト不変の追跡を実現する。
  • 再帰的フィルタ生成を通じて、高い精度と速度を維持する、フォワードパスでエンドツーエンド学習可能なトラッカーを開発する。

提案手法

  • 入力、隠れ状態、セル状態、出力状態がベクトルではなく特徴マップである畳み込みLSTMを採用し、空間的構造を保持する。
  • 例示画像と検索画像の特徴をそれぞれ別個のエンコーダー(E-CNNとS-CNN)で抽出し、重みを共有するか別々にする。
  • LSTM内の全結合層を2次元畳み込みに置き換えることで、空間的関係を維持し、メモリ効率を向上させる。
  • 畳み込みLSTMを介してターゲット固有のフィルタを生成し、それを次フレームの特徴マップとの相関演算におけるカーネルとして適用する。
  • トラッキング精度と収束性を向上させるために、LSTMのメモリ状態を専用の初期化ネットワークで初期化する。
  • 推論時のオンライン適応を回避するため、オフライン事前学習中にネットワーク全体をエンドツーエンドで学習する。

実験結果

リサーチクエスチョン

  • RQ1オンライン微調整を伴わずに、再帰的ニューラルネットワークをオブジェクト固有のフィルタ生成に効果的に適応できるか?
  • RQ2特徴マップによる入力での空間的構造の保持が、ベクトル表現と比較して追跡性能にどのように影響するか?
  • RQ3空間的に注意を払うメモリユニットを備えた畳み込みLSTMを用いることで、外見の変化や運動に対する耐性がどの程度向上するか?
  • RQ4標準ベンチマークにおいて、提案されたRFLフレームワークは、精度、速度、故障率の観点で最先端のトラッカーと比較してどのように差をつけるか?
  • RQ5E-CNNとS-CNNにおける初期化ネットワークと重み共有の、全体の追跡性能への寄与度は何か?

主な発見

  • OTB100ベンチマークでは、AUCスコアが0.601、成功率が0.460を達成し、KCF や DSST などの複数の最先端手法を上回った。
  • VOT2016では、最高の精度順位(1.72)と競争力のあるEAO(0.2222)を記録し、故障率3.07という結果から強力な耐性を示した。
  • VOT2017では、ベースライン実験で平均オーバーラップ0.48、非教師あり実験で0.23を達成し、リアルタイム速度は15.01 fpsであった。
  • アブレーションスタディの結果、E-CNNとS-CNN間の重み共有は性能を8–10%低下させた一方、初期化ネットワークと畳み込みLSTMの使用は性能を顕著に向上させた。
  • 定性的な結果では、高速移動、視界外、照明変化を伴う困難なシーケンスにおいて、DSST や SiamFC、KCF と比較して優れた性能を示した。
  • OTB100の成功プロットでは、RFLが全6つのチャレンジ属性において最良または同等の性能を示し、特に高速移動と視界外シナリオで顕著に優れていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。