Skip to main content
QUICK REVIEW

[論文レビュー] MAVOT: Memory-Augmented Video Object Tracking

Boyu Liu, Yanzhao Wang|arXiv (Cornell University)|Nov 26, 2017
Video Surveillance and Tracking Methods参考文献 15被引用数 8
ひとこと要約

MAVOTは、前景オブジェクトと背景の長期的特徴を格納・更新する外部メモリモジュールを用いた、ワンショットでメモリ拡張された動画オブジェクト追跡フレームワークを提案する。バックプロパゲーションを伴わずにこのメモリを取得・更新することで、遮蔽、運動変化、顔貌の大きな変化に対しても頑健な追跡を実現し、VOT-2016ベンチマークにおいて遮蔽耐性で2位、運動変化精度で1位を達成した。

ABSTRACT

We introduce a one-shot learning approach for video object tracking. The proposed algorithm requires seeing the object to be tracked only once, and employs an external memory to store and remember the evolving features of the foreground object as well as backgrounds over time during tracking. With the relevant memory retrieved and updated in each tracking, our tracking model is capable of maintaining long-term memory of the object, and thus can naturally deal with hard tracking scenarios including partial and total occlusion, motion changes and large scale and shape variations. In our experiments we use the ImageNet ILSVRC2015 video detection dataset to train and use the VOT-2016 benchmark to test and compare our Memory-Augmented Video Object Tracking (MAVOT) model. From the results, we conclude that given its oneshot property and simplicity in design, MAVOT is an attractive approach in visual tracking because it shows good performance on VOT-2016 benchmark and is among the top 5 performers in accuracy and robustness in occlusion, motion changes and empty target.

研究の動機と目的

  • オンライン学習の動画オブジェクト追跡における限界、すなわち限られた学習データ、バックプロパゲーションによる遅い適応、長期記憶の欠如を解決する。
  • 部分的または完全な遮蔽といった最近の干渉要因による誤差蓄積や混乱を防ぐために、オブジェクトおよび背景特徴の持続的記憶を維持する。
  • カテゴリ固有の事前学習や膨大なファインチューニングを必要とせず、一般オブジェクト追跡のワンショット学習を可能にする。
  • スケールおよび形状の変化、照明変化、カメラの動きといった困難な状況での追跡性能を向上させるために、前景および背景の両方の文脈をモデル化する。

提案手法

  • 深層畳み込みニューラルネットワーク(CNN)と外部メモリモジュールを統合し、時間経過に伴うターゲットオブジェクトおよび背景の特徴の変化を記憶する。
  • 格納された特徴との類似度に基づいて、各フレームの候補領域のスコアをメモリの取得により算出し、文脈に配慮した追跡意思決定を可能にする。
  • 現在のフレームの予測されたオブジェクト領域からの特徴を用いて、メモリモジュールを段階的に更新することで、外観の変化への適応を可能にする。
  • 完全畳み込み演算を採用し、オンラインバックプロパゲーションを回避することで、高速な推論とリアルタイム性能を実現する。
  • ImageNet ILSVRC2015動画データセットでの事前学習を活用し、多様なオブジェクトカテゴリのクラスに依存しない追跡を可能にする。
  • 前景と背景の両方のための別々のメモリ埋め込みを維持することで、複雑なシーンにおける識別性と頑健性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1オンラインバックプロパゲーションを伴わないメモリ拡張型ディープラーニングフレームワークは、ワンショットで頑健な動画オブジェクト追跡を達成できるか?
  • RQ2外部メモリモジュールは、困難な視覚的条件下でも長期的なオブジェクトおよび背景表現を維持するのにどの程度効果的か?
  • RQ3ワンショットトラッカーは、遮蔽および運動変化の状況において、最先端のオンライン学習トラッカーをどの程度上回ることができるか?
  • RQ4メモリに前景だけでなく背景までモデル化することで、前景のみのアプローチと比較して追跡精度と頑健性が向上するか?
  • RQ5オンラインファインチューニングなしの単純なエンドツーエンドトレーニング可能なアーキテクチャは、VOT-2016のような標準ベンチマークで競争力のある性能を達成できるか?

主な発見

  • MAVOTはVOT-2016ベンチマークで遮蔽耐性で2位、運動変化精度で1位を達成し、困難な追跡状況における高い耐性を示した。
  • 運動変化およびターゲットが空の状態のケースの検出精度で1位を記録し、動的かつ曖昧な条件下でも高い信頼性を示した。
  • オンラインバックプロパゲーションを伴わないワンショットトラッカーであるにもかかわらず、単一のNVIDIA GTX 1060 GPUで5fpsの推論速度を達成し、リアルタイム実現可能性を示した。
  • 長時間のシーケンスにおいても一貫した性能を維持し、『road』(558フレーム)や『girl』(1500フレーム)のような完全遮蔽後も正常に追跡を再開した。
  • 低照度で背景と類似度が高い『fish4』のような複雑な状況でも、他の最先端トラッカーを上回る精度を示した。
  • VOT-2016コンテストにおいて71の参加者の中での総合順位で16位を達成し、そのシンプルさとワンショット学習設計を考慮すると、非常に優れた結果であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。