[論文レビュー] Learning Feature Embeddings for Discriminant Model based Tracking
本稿では、畳み込みニューラルネットワークに微分可能で閉形式の判別モデルソルバー(リッジ回帰)を統合することで、オンライン判別的トラッキングのための最適な特徴埋め込みを学習する、エンド・ツー・エンドの深層学習フレームワークDCFSTを提案する。従来の相関フィルタの負の境界効果を回避し、エンド・ツー・エンドの学習を可能にすることで、6つのベンチマークで最先端の精度を達成するとともに、リアルタイム以上の速度で動作する。
After observing that the features used in most online discriminatively trained trackers are not optimal, in this paper, we propose a novel and effective architecture to learn optimal feature embeddings for online discriminative tracking. Our method, called DCFST, integrates the solver of a discriminant model that is differentiable and has a closed-form solution into convolutional neural networks. Then, the resulting network can be trained in an end-to-end way, obtaining optimal feature embeddings for the discriminant model-based tracker. As an instance, we apply the popular ridge regression model in this work to demonstrate the power of DCFST. Extensive experiments on six public benchmarks, OTB2015, NFS, GOT10k, TrackingNet, VOT2018, and VOT2019, show that our approach is efficient and generalizes well to class-agnostic target objects in online tracking, thus achieves state-of-the-art accuracy, while running beyond the real-time speed. Code will be made available.
研究の動機と目的
- オンラインで判別的に訓練されたトラッカーが通常使用する、事前学習済みImageNet特徴から得られる非最適な特徴埋め込みを改善すること。
- KCF や CFNet などの相関フィルタベースのトラッカーに内在する負の境界効果を解消するために、巡回サンプリングの代わりに直接微分可能な最適化を採用すること。
- CNNに閉形式で微分可能なソルバーを統合することで、特徴埋め込みと判別モデルのエンド・ツー・エンド学習を可能にすること。
- トラッキングサンプルにおける前景・背景クラスの不均衡に対処するため、正則化損失を変更することで、学習の一般化性と収束性を向上させること。
- 高い精度とリアルタイム効率を両立する、シンプルでありながら強力な視覚的トラッキングのベースラインを確立すること。
提案手法
- リッジ回帰という微分可能で閉形式の判別モデルソルバーを、CNN内に学習可能なレイヤーとして統合し、特徴埋め込みのエンド・ツー・エンド学習を可能にする。
- バックプロパゲーション中に高次元のリッジ回帰問題を効率的に解くために、ウッドベリーの恒等式を用いることで、計算効率を維持する。
- トラッキングにおける極端な前景・背景サンプルの不均衡が引き起こす収束問題を軽減するために、深層回帰から適応した修正された正則化損失を適用する。
- サポート画像とクエリ画像のペアを用いてネットワークを学習させ、テスト画像における判別モデルの予測を最適化する特徴埋め込みを学習する。
- サポート画像およびクエリ画像のターゲット周辺に実際で密なサンプリングを適用し、判別モデルに対する豊富な監視信号を提供する。
- テスト画像から学習済みの特徴埋め込みを抽出し、訓練済みのリッジ回帰モデルを適用することで、オンライントラッキングを実現する。
実験結果
リサーチクエスチョン
- RQ1微分可能で閉形式の判別モデルソルバーをCNNに効果的に統合し、オンライントラッキングのための最適な特徴埋め込みを学習できるか?
- RQ2巡回サンプリングを直接最適化に置き換えることで、負の境界効果が解消され、トラッキング精度が向上するか?
- RQ3特徴埋め込みと判別モデルのエンド・ツー・エンド学習が、未学習のオブジェクトクラスにおいてより優れた一般化性と頑健性をもたらすか?
- RQ4修正された正則化損失は、不均衡なトラッキングサンプルの文脈で、学習の収束性とモデル一般化性をどのように改善するか?
- RQ5提案されたフレームワークは、最先端の性能を達成するとともに、リアルタイム推論速度を維持できるか?
主な発見
- OTB2015ではDCFST-18が平均AUCスコア63.4%を達成し、DiMP-18(61.0%)とATOM(58.3%)をそれぞれ2.4%および5.1%上回った。
- GOT10kでは、オーバーラップ閾値0.5における成功率がDCFST-18で71.6%に達し、DiMP-18(67.2%)とATOM(63.4%)をそれぞれ4.4%および8.2%上回った。
- TrackingNetではDCFST-18が平均AUC73.9%を達成し、DiMP-18(72.3%)を1.6%上回り、ATOMを3.6%上回った。
- VOT2018ではDCFST-18とDCFST-50がEAOスコア0.416および0.452を記録し、DiMP-18(0.410)とDiMP-50(0.447)をそれぞれ1.4%および1.2%上回った。
- VOT2019ではDCFST-18がフルチャレンジとリアルタイムチャレンジでEAO 0.361および0.317を達成し、ATOMをそれぞれ6.9%および7.7%上回ったが、バックボーンはより小さい(ResNet-18)にもかかわらずである。
- OTB2015、GOT10k、VOT2019の3つのベンチマークすべてにおいて、DCFST-18は、より深いバックボーン(ResNet-50)とより多くの学習データを用いるSiamRPN++を上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。