Skip to main content
QUICK REVIEW

[論文レビュー] Learning the Model Update for Siamese Trackers

Lichao Zhang, Abel González-García|arXiv (Cornell University)|Aug 2, 2019
Video Surveillance and Tracking Methods参考文献 48被引用数 14
ひとこと要約

本論文では、シアンプルス・トラッカーにおける標準的な線形テンプレート更新を、データ駆動で適応的な更新戦略に置き換える学習可能な畳み込みニューラルネットワーク、UpdateNetを提案する。初期テンプレート、現在のフレーム特徴量、蓄積された履歴を活用することで、複数のベンチマークで追跡精度が向上し、DaSiamRPNと統合した際、TrackingNetで成功スコアに3.9%の絶対的向上を達成した。

ABSTRACT

Siamese approaches address the visual tracking problem by extracting an appearance template from the current frame, which is used to localize the target in the next frame. In general, this template is linearly combined with the accumulated template from the previous frame, resulting in an exponential decay of information over time. While such an approach to updating has led to improved results, its simplicity limits the potential gain likely to be obtained by learning to update. Therefore, we propose to replace the handcrafted update function with a method which learns to update. We use a convolutional neural network, called UpdateNet, which given the initial template, the accumulated template and the template of the current frame aims to estimate the optimal template for the next frame. The UpdateNet is compact and can easily be integrated into existing Siamese trackers. We demonstrate the generality of the proposed approach by applying it to two Siamese trackers, SiamFC and DaSiamRPN. Extensive experiments on VOT2016, VOT2018, LaSOT, and TrackingNet datasets demonstrate that our UpdateNet effectively predicts the new target template, outperforming the standard linear update. On the large-scale TrackingNet dataset, our UpdateNet improves the results of DaSiamRPN with an absolute gain of 3.9% in terms of success score.

研究の動機と目的

  • 動的な外見変化や部分的遮蔽に対応できない固定レートの線形テンプレート更新の限界を解消すること。
  • 視覚追跡におけるロバスト性と精度を向上させる、汎用的でコンactで学習可能な更新メカニズムを開発すること。
  • 初期フレーム、現在のフレーム、および蓄積されたテンプレートからの文脈的情報を用いて、オンラインでターゲットテンプレートを適応的に更新できること。
  • 長期間のシーケンスや顕著な外見変化を伴う多様な追跡シナリオにおいて、更新プロセスを学習することでその有効性を実証すること。

提案手法

  • UpdateNetは、初期の正解テンプレート、現在のフレームの特徴表現、および前回までのフレームからの蓄積テンプレートの3つの入力を受ける軽量なCNNである。
  • 入力テンプレートとターゲット外見の間の複雑な非線形関係を学習することで、次のフレーム用の最適な更新テンプレートを予測する。
  • 更新メカニズムはエンド・ツー・エンドで学習可能であり、SiamFC や DaSiamRPN などの既存のシアンプルス・トラッカーのコアアーキテクチャを変更せずにシームレスに統合可能である。
  • 推論中に追跡誤差を最小化するようにモデルを学習することで、関連する領域を優先的に適応的に処理し、ノイズや干渉要因を抑制できる。
  • 空間的に注意を払うテンプレートの最適化を学習することで、特に部分的遮蔽の状況で局所的な更新が有効になる。
  • UpdateNetはプラグアンドプレイの形で評価され、ベースとなるトラッカーの効率を保ちながら、オンライン適応能力を強化している。

実験結果

リサーチクエスチョン

  • RQ1学習可能な更新メカニズムは、多様な追跡シナリオにおいて、シアンプルス・トラッカーの標準的な線形更新ルールを上回ることができるか?
  • RQ2提案されたUpdateNetは、顕著な外見変化を伴う長期間追跡において、どのようにロバスト性を向上させるか?
  • RQ3ニューラルネットワークベースの更新戦略は、異なるシアンプルス・トラッカー・アーキテクチャにどの程度一般化可能か?
  • RQ4更新プロセスを学習することで、大規模ベンチマークにおける成功スコアと正確性指標に測定可能な向上が得られるか?

主な発見

  • UpdateNetは、大規模なTrackingNetデータセットにおいて、DaSiamRPNの成功スコアを3.9%絶対的に向上させ、現実世界の追跡において顕著な性能向上を示した。
  • LaSOTベンチマークでは、UpdateNetを搭載したトラッカーが、すべての最先端手法を上回り、正確性と成功スコアの両方で最高のパフォーマンスを達成した。
  • VOT2018では、ベースラインのDaSiamRPNに比べてEAOスコアが4.2%向上し、追跡の正確性とロバスト性が向上したことが示された。
  • Rスコア(ロバストネス指標)において、失敗率が5.6%低下し、追跡の失敗やドリフトからの回復能力が向上した。
  • 計算効率を維持し、最小限のオーバーヘッドで任意のシアンプルス・トラッカーに統合可能であり、一般化能力の高さを実証した。
  • アブレーションスタディにより、特にモーションブラーと遮蔽といった困難な条件下で、固定レートの線形更新よりも学習された更新戦略がより適応的であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。