Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Deep Representation Learning for Real-Time Tracking

Ning Wang, Wengang Zhou|arXiv (Cornell University)|Jul 22, 2020
Video Surveillance and Tracking Methods参考文献 76被引用数 7
ひとこと要約

本論文は、ラベルなし動画のみを用いて、完全に教師ありのアノテーションなしに、リアルタイム視覚追跡のための教師なし深層表現学習手法を提案する。前向きと後向きの追跡軌道の整合性を強制することで、ラベルなしのデータから頑健な特徴表現を学習し、完全に教師ありのベースラインと同等の追跡精度を達成しながら、リアルタイムの推論速度を維持する。

ABSTRACT

The advancement of visual tracking has continuously been brought by deep learning models. Typically, supervised learning is employed to train these models with expensive labeled data. In order to reduce the workload of manual annotations and learn to track arbitrary objects, we propose an unsupervised learning method for visual tracking. The motivation of our unsupervised learning is that a robust tracker should be effective in bidirectional tracking. Specifically, the tracker is able to forward localize a target object in successive frames and backtrace to its initial position in the first frame. Based on such a motivation, in the training process, we measure the consistency between forward and backward trajectories to learn a robust tracker from scratch merely using unlabeled videos. We build our framework on a Siamese correlation filter network, and propose a multi-frame validation scheme and a cost-sensitive loss to facilitate unsupervised learning. Without bells and whistles, the proposed unsupervised tracker achieves the baseline accuracy as classic fully supervised trackers while achieving a real-time speed. Furthermore, our unsupervised framework exhibits a potential in leveraging more unlabeled or weakly labeled data to further improve the tracking accuracy.

研究の動機と目的

  • ラベルなし動画データを活用することで、高価な手動アノテーションの必要性を排除する視覚追跡手法の開発。
  • 双方向運動整合性に基づく自己教師あり学習を用いて、深層トレッカーを完全にゼロから訓練する。
  • 事前学習モデルやラベル付きデータに依存せずに、完全に教師ありトレッカーと同等のリアルタイム性能を達成する。
  • 大規模な弱教師ありまたはラベルなしデータを用いた教師なし表現学習の視覚追跡への潜在的利活を検討する。

提案手法

  • 前向きと後向きの追跡軌道間の整合性に基づく自己教師あり損失を用いて、シアンプル相関フィルターネットワークを訓練する。
  • 時間的安定性を向上させ、自己教師あり訓練中の誤検出を低減するために、マルチフレーム検証方式を導入する。
  • 特にターゲット紛失や遮蔽状況において、整合性のない後向き追跡をペナルティ化するコストセンシティブ損失を設計する。
  • 最初のフレームにおいて高エントロピーの画像領域を初期化することで、手動によるバウンディングボックスアノテーションを回避する。
  • トレーニング中に一切真のラベルを使用せず、完全に教師なしのフレームワークで動作する。
  • 標準ベンチマーク(OTB-2015, VOT2018)で評価され、完全に教師ありおよび最先端のトレッカーと比較される。

実験結果

リサーチクエスチョン

  • RQ1ラベルなし動画のみを用いて、人為的バウンディングボックスアノテーションなしに、視覚トレッカーを効果的にゼロから訓練できるか?
  • RQ2前向きと後向きの追跡軌道の整合性を強制することで、頑健で汎用性の高い特徴表現が得られるか?
  • RQ3教師なし学習が、精度と速度の両面で完全に教師あり手法と同等の追跡性能を達成できるか?
  • RQ4遮蔽、運動ブラー、照明変動などの困難な視覚条件下で、本手法はどのように性能を示すか?

主な発見

  • 提案された教師なしトレッカーは、OTB-2015ベンチマークにおいて、SiamFC や CFNet といった古典的な完全に教師ありトレッカーと同等のベースライン精度を達成する。
  • 教師なし LUDT トレッカーは最先端手法と比較しても優れた性能を示し、ラベルなしデータを一切使用せず、OTB-2015 において AUC で ECO を 0.9% 上回る。
  • LUDT+ の変種はオンラインモデル更新を統合しており、性能がさらに向上し、追跡精度で ECO を上回る。
  • 背景の雑音、部分的遮蔽、運動ブラーなどの困難な状況でも強靭性を示し、定性的な評価で DSST や SiamFC を上回る。
  • アブレーションスタディにより、マルチフレーム検証とコストセンシティブ損失が訓練の安定性と追跡精度を顕著に向上させることを確認した。
  • 特徴の可視化と属性分析から、教師なし特徴が判別力があり、良好に一般化していることが明らかになったが、照明変動、遮蔽、高速運動の状況では性能ギャップが依然として存在する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。