Skip to main content
QUICK REVIEW

[論文レビュー] Exploring Lightweight Hierarchical Vision Transformers for Efficient Visual Tracking

Ben Kang, Xin Chen|arXiv (Cornell University)|Aug 14, 2023
Visual Attention and Saliency Detection被引用数 6
ひとこと要約

本論文は、深層の意味的特徴と浅層の高解像度特徴を統合するブリッジモジュールと、二重画像位置符号化を用いて空間認識を向上させる、効率的な視覚追跡を目的とした軽量階層的ビジョントランスフォーマーであるHiTを提案する。HiTはLaSOTで64.6%のAUCを達成し、Jetson AGXエッジデバイスで61fpsで動作し、従来の効率的なトラッカーを上回る速度と精度を実現した。

ABSTRACT

Transformer-based visual trackers have demonstrated significant progress owing to their superior modeling capabilities. However, existing trackers are hampered by low speed, limiting their applicability on devices with limited computational power. To alleviate this problem, we propose HiT, a new family of efficient tracking models that can run at high speed on different devices while retaining high performance. The central idea of HiT is the Bridge Module, which bridges the gap between modern lightweight transformers and the tracking framework. The Bridge Module incorporates the high-level information of deep features into the shallow large-resolution features. In this way, it produces better features for the tracking head. We also propose a novel dual-image position encoding technique that simultaneously encodes the position information of both the search region and template images. The HiT model achieves promising speed with competitive performance. For instance, it runs at 61 frames per second (fps) on the Nvidia Jetson AGX edge device. Furthermore, HiT attains 64.6% AUC on the LaSOT benchmark, surpassing all previous efficient trackers.

研究の動機と目的

  • リソース制限のあるエッジデバイスにおいて、トランスフォーマーに基づく視覚トラッカーのパフォーマンスと速度のトレードオフを解消すること。
  • 追跡に用いられる軽量階層的バックボーンにおける大スライドダウンサンプリングが引き起こす情報損失を軽減すること。
  • テンプレートとサーチ領域の両方の画像の位置情報を統合的に符号化することで、追跡における空間モデリングを向上させること。
  • 軽量階層的トランスフォーマーの効率的デプロイメントを可能にする汎用的なフレームワークの開発。

提案手法

  • 深層からの高レベル意味的特徴と浅層の高解像度特徴を統合することで、ダウンサンプリングによる空間的詳細の損失を防ぐブリッジモジュールを導入する。
  • テンプレートとサーチ領域を対角配置で一意で重複のない位置に割り当てることで、両領域の位置情報を統合的に符号化する二重画像位置符号化を提案する。
  • 事前学習済みの軽量階層的ビジョントランスフォーマーバックボーン(LeViT や PVT)を用いたワンストリーム追跡フレームワークを採用し、エンドツーエンドの特徴抽出と統合を実現する。
  • 二重画像構成において相対的位置符号化を採用することで、重複または不要な位置符号化を回避しつつ、画像間の空間的関係をモデル化する。
  • LeViT-384 や PVT-Small などの異なる軽量階層的バックボーンを簡単に統合できるモジュラー構造としてHiTフレームワークを設計する。
  • 標準のトラッキング損失関数と標準のトラッキングヘッドを用いて学習を行うが、軽量なコンponentsを維持することで推論効率を確保する。

実験結果

リサーチクエスチョン

  • RQ1大スライドダウンサンプリングによる情報損失を考慮しても、軽量階層的ビジョントランスフォーマーが視覚追跡に効果的に適応可能か?
  • RQ2テンプレートとサーチ領域の位置情報を統合的に符号化することで、個別符号化と比較して追跡性能がどのように向上するか?
  • RQ3提案されたブリッジモジュールは、エッジデバイスでの高速推論を維持しつつ、空間的詳細を効果的に回復できるか?
  • RQ4HiTフレームワークは、LeViT や PVT などの異なる軽量階層的バックボーンに一般化可能か?
  • RQ5HiTはエッジプラットフォーム上での効率的視覚トラッカーにおける最先端の速度・精度トレードオフを達成できるか?

主な発見

  • HiTはLaSOTベンチマークで64.6%のAUCを達成し、すべての従来の効率的トラッカーを上回り、高性能モデルと同等またはそれを上回る性能を示した。
  • HiTはNvidia Jetson AGX Xavierエッジデバイスで61fpsで動作し、TransT(13fps)やFEAR(38fps)を大きく上回る速度を達成した。
  • HiT-Baseは同じエッジプラットフォーム上でのFEARより11.1%高いAUCを達成した一方で、1.6倍高速であった。
  • PVT-Smallバックボーンを搭載したHiTは、LaSOTで63.9%、TrackingNetで78.4%のAUCを達成し、バックボーン間での優れた一般化性能を示した。
  • 対角配置による二重画像位置符号化は、絶対符号化、別々の相対符号化、垂直および水平符号化と比較して優れた性能を示し、最高のAUCスコアを達成した。
  • HiTはAGXプラットフォーム上でSTARK-ST50の4.7倍高速でありながら、同等の性能を維持しており、リアルタイムデプロイメントにおける優位性を実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。