Skip to main content
QUICK REVIEW

[論文レビュー] Convolutional Regression for Visual Tracking

Kai Chen, Wenbing Tao|arXiv (Cornell University)|Nov 14, 2016
Video Surveillance and Tracking Methods参考文献 21被引用数 7
ひとこと要約

本論文では、従来の判別的相関フィルタ(DCF)の代わりに勾配最適化による1チャネル畳み込み層を用いて、合成されない実際のサンプルから回帰モデルを学習する、新しいフレームワークである畳み込み回帰による視覚追跡(CRT)を提案する。無制限の実際の負例サンプルを組み込み、自動ハードネガティブマッピングを用いることで、OTB-100およびOTB-50で最先端の性能を達成し、既存のすべてのDCFベースのトラッカーを大きく上回った。

ABSTRACT

Recently, discriminatively learned correlation filters (DCF) has drawn much attention in visual object tracking community. The success of DCF is potentially attributed to the fact that a large amount of samples are utilized to train the ridge regression model and predict the location of object. To solve the regression problem in an efficient way, these samples are all generated by circularly shifting from a search patch. However, these synthetic samples also induce some negative effects which weaken the robustness of DCF based trackers. In this paper, we propose a Convolutional Regression framework for visual tracking (CRT). Instead of learning the linear regression model in a closed form, we try to solve the regression problem by optimizing a one-channel-output convolution layer with Gradient Descent (GD). In particular, the receptive field size of the convolution layer is set to the size of object. Contrary to DCF, it is possible to incorporate all "real" samples clipped from the whole image. A critical issue of the GD approach is that most of the convolutional samples are negative and the contribution of positive samples will be suppressed. To address this problem, we propose a novel Automatic Hard Negative Mining method to eliminate easy negatives and enhance positives. Extensive experiments are conducted on a widely-used benchmark with 100 sequences. The results show that the proposed algorithm achieves outstanding performance and outperforms almost all the existing DCF based algorithms.

研究の動機と目的

  • 判別的相関フィルタ(DCF)の限界を解決すること。DCFは、過剰な背景コンテキストを含む合成的で循環的にシフトされたサンプルに依存しており、ロバストネスを制限する。
  • トレーニングおよびインフェレンス時に画像全体からの実際の非合成的サンプルを活用できる、より効果的な回帰ベースの視覚追跡フレームワークを開発すること。
  • 95%以上のサンプルが負例であるクラス不均衡問題を克服すること。具体的には、正例を強化し、簡単な負例を抑圧するための自動ハードネガティブマッピング戦略を導入すること。
  • 深層特徴と微分可能でエンドツーエンドでトレーニング可能な回帰モデルを組み合わせることで、標準ベンチマークで最先端の性能を達成すること。

提案手法

  • 提案されたCRTフレームワークは、物体のサイズと等しい受容 field サイズを持つ1つの1チャネル出力畳み込み層を用い、画像全体のパッチに対して回帰を実行する。
  • リッジ回帰の閉形式解を用いるのではなく、モデルパラメータ(重みおよびバイアス)をバックプロパゲーションを伴う確率的勾配降下法(SGD)で最適化し、回帰損失を最小化する。
  • DCF や SRDCF に内在する合成サンプリングバイアスを回避するため、画像全体をスライディングウィンドウで抽出した実際のサンプルを活用する。
  • 自動ハードネガティブマッピング手法を導入:切断損失関数が簡単な負例を抑圧し、重み付き損失関数がトレーニング中の正例の寄与度を高める。
  • VGG-conv-10 などの深層特徴と互換性があり、TensorFlow や Caffe などのディープラーニングフレームワークで実装可能である。
  • 簡単な負例をフィルタリングし、最適化を硬く情報量の多いサンプルに集中させることで、トレーニングの高速化が図られ、収束速度が向上する。

実験結果

リサーチクエスチョン

  • RQ1微分可能で勾配最適化された畳み込み層は、リッジ回帰の閉形式解を上回る性能を発揮できるか?
  • RQ2循環的にシフトされた合成的サンプルではなく、実際の非合成的サンプルを用いることで、トラッカーのロバストネスと精度が向上するか?
  • RQ3自動ハードネガティブマッピングは、負例が正例を大幅に上回るトラッキングにおけるクラス不均衡問題を効果的に緩和できるか?
  • RQ4提案された畳み込み回帰フレームワークは、OTB-100 や OTB-50 といった標準ベンチマークで、最先端のDCFベースのトラッカーと比較してどうなるか?

主な発見

  • CRTは、精度と成功率プロットの両面で、OTB-100およびOTB-50の両方で1位を達成し、既存のすべてのDCFベースのトラッカーを上回った。
  • より困難なOTB-50ベンチマークにおいて、CRTは前回のSOTA DCFベースのトラッカーであるDeepSRDCFと比較して、精度で8%、成功率で6%の向上を達成した。
  • OTB-100の全11属性において、CRTは最高のDP(距離精度)スコアを達成し、スケール変化、平面外回転、低解像度の3属性において、2番目に良いトラッカーと比較して5ポイント以上も向上した。
  • 定性的な結果から、CRTは著しい変形、回転、背景の雑音下でも物体を正常に追跡できる一方、SRDCF や KCF のようなDCFベースのトラッカーは背景にずれていくことが確認された。
  • 自動ハードネガティブマッピング手法により、簡単な負例をフィルタリングし、最適化を硬く情報量の多いサンプルに集中させることで、トレーニングが著しく高速化された。
  • 広範な実際の負例サンプルの統合のおかげで、CRTは特にスケール変化や低解像度の状況において、優れたロバストネスと精度を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。