Skip to main content
QUICK REVIEW

[論文レビュー] Learn to Match: Automatic Matching Network Design for Visual Tracking

Zhipeng Zhang, Yihao Liu|arXiv (Cornell University)|Aug 2, 2021
Video Surveillance and Tracking Methods参考文献 40被引用数 12
ひとこと要約

本稿では、自己教師付きのマッチングネットワーク設計フレームワークAutoMatchを提案する。この手法は、ヒューリスティックなクロス相関を、6つの新規マッチング演算子—連結、ポイントワイズ加算、ペairワイズ関係、FiLM、シンプルトランスフォーマー、伝達的ガイダンス—の学習された組み合わせに置き換える。この組み合わせは、微分可能バイナリチャネル操作(BCM)探索アルゴリズムによって実現される。本手法は、OTB100、LaSOT、TrackingNetで最先端の性能を達成し、それぞれ成功スコアで4.2、5.7、5.7ポイントの向上を達成。50 FPSで動作し、ベースラインのOceanトラッカーと比較して訓練データ/時間の半分未満で実現した。

ABSTRACT

Siamese tracking has achieved groundbreaking performance in recent years, where the essence is the efficient matching operator cross-correlation and its variants. Besides the remarkable success, it is important to note that the heuristic matching network design relies heavily on expert experience. Moreover, we experimentally find that one sole matching operator is difficult to guarantee stable tracking in all challenging environments. Thus, in this work, we introduce six novel matching operators from the perspective of feature fusion instead of explicit similarity learning, namely Concatenation, Pointwise-Addition, Pairwise-Relation, FiLM, Simple-Transformer and Transductive-Guidance, to explore more feasibility on matching operator selection. The analyses reveal these operators' selective adaptability on different environment degradation types, which inspires us to combine them to explore complementary features. To this end, we propose binary channel manipulation (BCM) to search for the optimal combination of these operators. BCM determines to retrain or discard one operator by learning its contribution to other tracking steps. By inserting the learned matching networks to a strong baseline tracker Ocean, our model achieves favorable gains by $67.2 ightarrow 71.4$, $52.6 ightarrow 58.3$, $70.3 ightarrow 76.0$ success on OTB100, LaSOT, and TrackingNet, respectively. Notably, Our tracker, dubbed AutoMatch, uses less than half of training data/time than the baseline tracker, and runs at 50 FPS using PyTorch. Code and model will be released at https://github.com/JudasDie/SOTS.

研究の動機と目的

  • 自己教師付きマッチング演算子設計の限界に対処する。これは、熟練知識に依存しており、多様な追跡課題に対しては頑健性に欠ける。
  • クロス相関を超える、特徴統合に基づく代替手法を含む、より広いマッチング演算子の探索空間を提供し、一般化性と耐性を向上させる。
  • 分類および回帰ブランチの両方に対して最適なマッチング演算子の組み合わせを学習する自動探索機構を開発する。
  • マニュアル設計に依存しないように、演算子選択のための微分可能で学習可能なチャネルレベル操作戦略を導入する。
  • Oceanのような強力なベースラインと比較して、より低い訓練データおよび推論時間で高い性能を達成する。

提案手法

  • 特徴統合に基づく、明示的な類似度学習とは異なる6つの新規マッチング演算子を提案:連結、ポイントワイズ加算、ペアワイズ関係、FiLM、シンプルトランスフォーマー、伝達的ガイダンス。
  • バイナリチャネル操作(BCM)を導入。各特徴チャネルに、追跡性能への寄与度を評価する学習可能な操作子を割り当てる。
  • Gumbel-Softmaxを用いて、操作子を微分可能に離散化(保持または破棄)し、エンドツーエンドの学習を可能にする。
  • 二段階最適化を用いて、ネットワーク重みと最適なマッチング演算子の探索を同時に最適化。バリデーションセットの性能を報酬信号として使用。
  • 学習されたマッチングネットワークを、Oceanトラッカーの分類および回帰ブランチに適用し、タスク固有の演算子選択を可能にする。
  • 探索されたマッチングネットワークをベースラインのOceanトラッカーに統合し、標準的な自己教師付きトレーニング手順に従って再訓練する。

実験結果

リサーチクエスチョン

  • RQ1複数のマッチング演算子の学習された組み合わせは、自己教師付きマッチングの標準的手法であるクロス相関を上回ることができるか?
  • RQ2異なるマッチング演算子は、特定の視覚的劣化(例:隠蔽、運動ブラー、背景の雑音)に対して選択的に適応する性質を示すか?
  • RQ3微分可能でチャネルレベルの探索機構は、人為的なヒューリスティクスなしに最適なマッチング演算子の組み合わせを効果的に同定できるか?
  • RQ4提案手法の探索法は、異なる追跡ベンチマークに一般化可能であり、訓練コストを低減しつつより高い性能を達成できるか?
  • RQ5学習されたマッチングネットワークは、リアルタイム追跡システムに効率的に統合可能か?

主な発見

  • OTB100では、成功スコアが67.2から71.4に上昇し、4.2ポイントの向上を達成。ベースラインのOceanトラッカーを上回った。
  • LaSOTでは、成功スコアが52.6から58.3に上昇し、長期追跡シナリオにおける頑健性の向上が確認された。
  • TrackingNetでは、成功スコアが76.0に達し、ベースラインのOcean(70.3)およびメタラーニングベースのMAMLTrack(75.7)を上回った。
  • GOT10Kでは、Oceanと比較してSR 0.75で7.8ポイント、SR 0.5で7.1ポイントの向上を達成。50 FPSで動作(Oceanは40 FPS)。
  • TNL2Kでは、比較対象の全トラッカーの中で最高の成功スコアおよび精度スコアを達成。多様で挑戦的なシーケンスへの一般化性を確認。
  • アブレーションスタディの結果、スカラーベースの演算子選択よりもチャネルレベルの操作子が優れており、ランダム探索は著しく劣ることが判明。BCM探索アルゴリズムの有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。