[論文レビュー] Once for All: a Two-flow Convolutional Neural Network for Visual Tracking
本稿では、オブジェクトパッチとサーチ領域間の類似度測定として視覚追跡を扱う2フロー畳み込みニューラルネットワークYCNNを提案する。これにより、オンライン再訓練を必要とせずエンドツーエンドの学習が可能になる。訓練が終了した後、YCNNは45 FPSで任意のオブジェクトを追跡でき、遮蔽、変形、空間的摺りずれに対して優れた耐性を示し、最先端の精度を達成する。
One of the main challenges of visual object tracking comes from the arbitrary appearance of objects. Most existing algorithms try to resolve this problem as an object-specific task, i.e., the model is trained to regenerate or classify a specific object. As a result, the model need to be initialized and retrained for different objects. In this paper, we propose a more generic approach utilizing a novel two-flow convolutional neural network (named YCNN). The YCNN takes two inputs (one is object image patch, the other is search image patch), then outputs a response map which predicts how likely the object appears in a specific location. Unlike those object-specific approach, the YCNN is trained to measure the similarity between two image patches. Thus it will not be confined to any specific object. Furthermore the network can be end-to-end trained to extract both shallow and deep convolutional features which are dedicated for visual tracking. And once properly trained, the YCNN can be applied to track all kinds of objects without further training and updating. Benefiting from the once-for-all model, our algorithm is able to run at a very high speed of 45 frames-per-second. The experiments on 51 sequences also show that our algorithm achieves an outstanding performance.
研究の動機と目的
- 頻繁な再訓練を要するオブジェクト固有の追跡モデルの限界を解消すること。
- オブジェクト固有のファインチューニングに依存しない汎用的かつ再利用可能な追跡フレームワークを構築すること。
- 浅い層と深い層の両方の深層特徴を活用して、追跡の耐性を向上させること。
- 類似度マッチングによりオブジェクト位置を予測するコンactなCNNのエンドツーエンド学習を可能とすること。
- 追跡中にオンライン適応を排除することで、高速な推論速度を達成すること。
提案手法
- YCNNは、オブジェクトテンプレート用とサーチ領域用の2つの並列畳み込みストリームを使用する。
- 両ストリームの浅い層および深い層の特徴が連結され、全結合層に供給され、2次元の応答マップが生成される。
- 外見の変動を模倣するために、データ拡張(回転、平行移動、ノイズ)を施したImageNetパッチを用いて事前学習を行う。
- 追跡固有のパターンに適応するため、実際の追跡シーケンスを用いてファインチューニングを実施する。
- 信頼性スコアに基づく統合フレームワークにより、複数の候補オブジェクトパッチをその信頼性に応じて重み付けし、耐性を向上させる。
- バックプロパゲーションなしで推論を実行するため、45 FPSのリアルタイム性能を実現する。
実験結果
リサーチクエスチョン
- RQ1一度学習した単一のCNNモデルを、再訓練なしで任意のオブジェクトに適用可能か?
- RQ22フローCNNアーキテクチャが、視覚追跡におけるオブジェクトパッチとサーチパッチ間の類似度を効果的に測定できるか?
- RQ3浅い層と深い層の特徴をエンドツーエンドで学習することで、外見の変動下でも追跡の耐性が向上するか?
- RQ445 FPSという高い速度を維持しながら、既存のトラッカーを上回る精度と安定性を達成できるか?
- RQ5信頼性ベースの統合メカニズムは、遮蔽や変形の状況下で性能をどのように向上させるか?
主な発見
- 空間的耐性評価(SRE)において、YCNNはAUCスコア0.569を達成し、2番目に良いトラッカーMEEMよりも10%高い。
- ワンパス評価(OPE)では、6つのプロットのうち5つで9つの最先端トラッカーを上回り、MEEMにわずかに劣る程度であった。
- トラッカーは45フレーム毎秒で動作し、他のCNNベースのトラッカー(例:過去の研究では1〜3 FPS)に比べて顕著に高速である。
- 初期バウンディングボックスのシフトやスケーリングといった空間的摺りずれに対しても、YCNNは優れた耐性を示す。
- オブジェクトと背景のコントラストが高いシーケンス(例:Skiing, Tiger2)では良好に動作するが、背景のゴミダミングが強いシーケンス(例:Subway, Walking2)では困難を示す。
- 信頼性ベースの統合メカニズムにより、遮蔽や変形時における予測の安定性が向上する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。