Skip to main content
QUICK REVIEW

[論文レビュー] Non-rigid Object Tracking via Deep Multi-scale Spatial-temporal Discriminative Saliency Maps

Pingping Zhang, Wei Liu|arXiv (Cornell University)|Feb 22, 2018
Video Surveillance and Tracking Methods参考文献 68被引用数 12
ひとこと要約

本論文では、非剛性オブジェクトを高精度なピクセル単位の追跡を実現するために、マルチスケール時空間的特徴抽出マップを活用した深層学習ベースの非剛性オブジェクト追跡手法を提案する。特徴的な完全畳み込みネットワーク(TFCN)とマルチリージョンのエントロピー加重融合を用いることで、背景汚染が一般的なボクシングボックスベースの手法とは異なり、困難なシーケンスにおいても追跡精度と耐障害性が向上し、非剛性データセットにおけるボクシングボックスとセグメンテーションのオーバーラップ比の両面で最先端のトラッカーを上回る性能を発揮する。

ABSTRACT

In this paper, we propose a novel effective non-rigid object tracking framework based on the spatial-temporal consistent saliency detection. In contrast to most existing trackers that utilize a bounding box to specify the tracked target, the proposed framework can extract accurate regions of the target as tracking outputs. It achieves a better description of the non-rigid objects and reduces the background pollution for the tracking model. Furthermore, our model has several unique features. First, a tailored fully convolutional neural network (TFCN) is developed to model the local saliency prior for a given image region, which not only provides the pixel-wise outputs but also integrates the semantic information. Second, a novel multi-scale multi-region mechanism is proposed to generate local saliency maps that effectively consider visual perceptions with different spatial layouts and scale variations. Subsequently, local saliency maps are fused via a weighted entropy method, resulting in a final discriminative saliency map. Finally, we present a non-rigid object tracking algorithm based on the predicted saliency maps. By utilizing a spatial-temporal consistent saliency map (STCSM), we conduct target-background classification and use a simple fine-tuning scheme for online updating. Extensive experiments demonstrate that the proposed algorithm achieves competitive performance in both saliency detection and visual tracking, especially outperforming other related trackers on the non-rigid object tracking datasets.

研究の動機と目的

  • ボクシングボックスベースの手法で一般的な背景汚染を回避しつつ、正確なピクセル単位のセグメンテーションを実現する非剛性オブジェクトの追跡に挑戦する。
  • 遮蔽、照明変化、ポーズ変化の下でも追跡の耐障害性を向上させるために、サリエンシー検出に空間的・時間的整合性を統合する。
  • 局所的サリエンシー事前知識と意味的理解、スケールに敏感な認識をモデル化する深層学習フレームワークを構築し、ターゲットと背景の識別を向上させる。
  • 時間経過に伴う外観変化を捉えるシンプルなファインチューニングスキームにより、オンラインでのモデル適応を可能にする。

提案手法

  • サリエンシー検出データセット上でトレーニングされた特徴的な完全畳み込みニューラルネットワーク(TFCN)は、ピクセル単位の出力と統合された意味的文脈を備えた局所的サリエンシー・マップを予測する。
  • マルチスケール・マルチリージョン機構により、異なる空間的レイアウトとスケールでの画像領域を分析し、複数の局所的サリエンシー・マップを生成する。
  • サリエンシー・マップは加重エントロピー法を用いて統合され、ターゲットを強調し、背景を抑制する最終的な特徴的なサリエンシー・マップが生成される。
  • オンラインでのターゲット-背景分類に、空間的・時間的整合性を持つサリエンシー・マップ(STCSM)モデルが使用される。
  • トラッカーは、モデルの更新とフレーム間の外観変化への適応を可能にするシンプルなオンラインファインチューニングスキームを採用する。
  • 本手法は、OTB-50および非剛性追跡データセットを含む標準ベンチマークにおいて、ボクシングボックスとセグメンテーションのオーバーラップ比を用いて評価される。

実験結果

リサーチクエスチョン

  • RQ1正確なピクセル単位のセグメンテーションを生成することで、深層サリエンシー検出フレームワークを非剛性オブジェクト追跡に効果的に適応できるか?
  • RQ2マルチスケールおよびマルチリージョンのサリエンシー・マップ生成は、スケール変動や空間的レイアウト変化に対する追跡の耐障害性をどのように向上させるか?
  • RQ3サリエンシー・マップにおける空間的・時間的整合性は、遮蔽や外観ドリフトの下でも追跡性能をどの程度向上させるか?
  • RQ4加重エントロピー融合されたサリエンシー・マップは、単一スケールまたは非統合アプローチを上回る特徴的なターゲット局所化性能を発揮するか?
  • RQ5提案手法は、剛性および非剛性オブジェクト追跡ベンチマークにどの程度一般化可能か?

主な発見

  • 提案されたトラッカーは、非剛性追跡シーケンスで平均55.0%のセグメンテーションオーバーラップ比を達成し、ベースラインの変種および最先端の手法を著しく上回る。
  • 挑戦的なDivingシーケンスでは、完全な遮蔽後もターゲットを正常に回復させることが可能であり、他のトラッカーは再検出に失敗している。
  • アブレーションスタディの結果、スケール依存のサリエンシー統合または時間的蓄積を削除すると、性能は55.0%から36.8%に低下し、両者が不可欠であることが証明された。
  • OTB-50ベンチマークでも競争力のある性能(正確性 = 0.842、成功率 = 0.561)を発揮し、2番目に優れた非剛性トラッカー(OGBT)を両指標で上回った。
  • 定性的な結果では、Gymnastics や High-jump などの複雑なシーケンスにおいても、滑らかな追跡出力と明確な境界、より良い意味的文脈の保持が得られている。
  • トラッカーはピクセル単位のサリエンシー・マップを生成するため、ボクシングボックスベースの手法よりも情報量が多く、特に変形可能で関節を持つオブジェクトにおいて顕著な利点を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。