[論文レビュー] Deep Attentive Tracking via Reciprocative Learning
本稿では、トレーニング中に勾配に基づく注目マップを正則化として用いることで、視覚的注目を深層検出ベーストラッキングネットワークに統合する逆伝播的学習フレームワークを提案する。既存の方法が別個の注目モジュールを追加するのとは異なり、分類スコアを逆伝播させて注目マップを生成し、分類器が時間的に安定した特徴に注目するように誘導する。OTB-2013、OTB-2015、VOT-2016ベンチマークで最先端の性能を達成している。
Visual attention, derived from cognitive neuroscience, facilitates human perception on the most pertinent subset of the sensory data. Recently, significant efforts have been made to exploit attention schemes to advance computer vision systems. For visual tracking, it is often challenging to track target objects undergoing large appearance changes. Attention maps facilitate visual tracking by selectively paying attention to temporal robust features. Existing tracking-by-detection approaches mainly use additional attention modules to generate feature weights as the classifiers are not equipped with such mechanisms. In this paper, we propose a reciprocative learning algorithm to exploit visual attention for training deep classifiers. The proposed algorithm consists of feed-forward and backward operations to generate attention maps, which serve as regularization terms coupled with the original classification loss function for training. The deep classifier learns to attend to the regions of target objects robust to appearance changes. Extensive experiments on large-scale benchmark datasets show that the proposed attentive tracking method performs favorably against the state-of-the-art approaches.
研究の動機と目的
- 動画シーケンス内で顕著な外見変化を受けるオブジェクトを追跡する課題に対処すること。
- 外部の注目モジュールに依存せずに、検出ベースフレームワークにおける深層分類器の識別力を向上させること。
- 注目正則化を用いたエンドツーエンド学習により、深層分類器が時間的に安定した特徴に注目するように学習すること。
- 勾配から導出された注目マップを監督として活用することで、背景の干渉を低減し、局所化精度を向上させること。
提案手法
- 入力サンプルを深層ネットワークを介して順伝播させ、分類スコアを計算する。
- 最終層から入力層へ向かう逆伝播を実行し、分類スコアと入力との偏微分を計算する。
- 入力層での得られた勾配マップを、分類に寄与するピクセル単位の重要性を示す注目マップと解釈する。
- この注目マップを損失関数における正則化項として用い、トレーニング中に元の分類損失と組み合わせる。
- 標準的なバックプロパゲーションによりネットワークを学習させ、分類器が時間的に安定した特徴に注目するように学習させる。
- 推論時においては、注目マップは生成されず、訓練済みの分類器が各プロポーザルに対して直接スコアを予測する。
実験結果
リサーチクエスチョン
- RQ1勾配に基づく注目マップは、深層分類器の正則化に効果的であり、追跡の頑健性を向上させることができるか?
- RQ2注目正則化を用いたエンドツーエンド学習は、別個の注目モジュールを用いる手法を上回る性能を示すか?
- RQ3明示的な注目モジュールなしで、分類器が時間的に一貫した特徴に注目するように学習できるか?
- RQ4大規模ベンチマークにおいて、提案手法は最先端のトラッカーと比較してどのように性能を発揮するか?
主な発見
- OTB-2013データセットでは、中心位置誤差が13.99、オーバーラップ成功率が0.860を記録し、ベースラインのMDNetを上回った。
- OTB-2015では、中心位置誤差が14.65、オーバーラップ成功率が0.780を記録し、連続的サンプリングを用いないにもかかわらず強力な性能を示した。
- VOT-2016では、EAOスコアが0.320で7つの比較対象トラッカーの中で2位となり、精度ランクが1.47、頑健性ランクが2.10を達成した。
- オフラインで補助データへの事前学習を行わなくても、ベースラインのMDNetに比べて中心位置誤差と成功率が顕著に向上した。
- 提案手法は、3つのベンチマークデータセットすべてで最先端の性能を達成し、勾配に基づく注目を用いた逆伝播的学習の有効性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。