Skip to main content
QUICK REVIEW

[論文レビュー] LightTrack: Finding Lightweight Neural Networks for Object Tracking via One-Shot Architecture Search

Bin Yan, Houwen Peng|arXiv (Cornell University)|Apr 29, 2021
Video Surveillance and Tracking Methods参考文献 57被引用数 12
ひとこと要約

LightTrackは、軽量で高性能なオブジェクトトラッカーを自動的に設計するワンショットニューラルアーキテクチャサーチ(NAS)フレームワークを提案する。ImageNetおよびトラッキングデータで事前学習されたスーパーネット内でバックボーンとヘッドアーキテクチャを同時に探索することで、SOTAトラッカー(SiamRPN++ や Ocean など)と比較して最大98.9%少ないFLOPs、13倍少ないパラメータで最先端のEAO性能を達成し、モバイルおよびエッジデバイスでのリアルタイム推論を可能にする。

ABSTRACT

Object tracking has achieved significant progress over the past few years. However, state-of-the-art trackers become increasingly heavy and expensive, which limits their deployments in resource-constrained applications. In this work, we present LightTrack, which uses neural architecture search (NAS) to design more lightweight and efficient object trackers. Comprehensive experiments show that our LightTrack is effective. It can find trackers that achieve superior performance compared to handcrafted SOTA trackers, such as SiamRPN++ and Ocean, while using much fewer model Flops and parameters. Moreover, when deployed on resource-constrained mobile chipsets, the discovered trackers run much faster. For example, on Snapdragon 845 Adreno GPU, LightTrack runs $12 imes$ faster than Ocean, while using $13 imes$ fewer parameters and $38 imes$ fewer Flops. Such improvements might narrow the gap between academic models and industrial deployments in object tracking task. LightTrack is released at https://github.com/researchmm/LightTrack.

研究の動機と目的

  • モバイルデバイスやドローンなどのリソース制約のある環境への展開を妨げる、最先端のオブジェクトトラッカーにおけるモデルの複雑さと計算コストの増大に対処する。
  • 情報損失による性能低下を引き起こすことが多く、精度を損なう可能性があるモデル圧縮技術(例:プルーニング、量子化)の限界を克服する。
  • 時間とコストがかかる上にトラッキング固有のニーズに最適でない、熟練者が設計した手作業のアーキテクチャに依存しないようにする。
  • オブジェクトトラッキングに特化した、コンactで高性能なニューラルアーキテクチャを自動かつ効率的に探索する手法を開発する。
  • FLOPsとパラメータ数を最小限に抑えながら精度を損なわずに、エッジハードウェア上でディープラーニングベースのトラッキングモデルをリアルタイムで展開可能にする。

提案手法

  • ImageNetで事前学習し、トラッキングデータでファインチューニングしたバックボーンスーパーネットと、直接トラッキングデータで学習するヘッドスーパーネットを用いた、オブジェクトトラッキングに特化したワンショットNASフレームワークを構築する。
  • 効率的なアーキテクチャサーチを可能にするために、ディープワイズ分離畳み込み(DSConv)とモバイルインバーテッドボトルネック(MBConv)ブロックを用いた軽量な探索空間を構築する。
  • バックボーンとヘッドのスーパーネットを一度だけ学習し、アーキテクチャ評価に直接重みを継承することで、高速かつ効率的な探索を実現する。
  • トラッキング精度とモデルの複雑さ(FLOPs、パラメータ数)をマルチオブジェクティブな監視信号として用い、アーキテクチャサーチを実施する。
  • 特徴表現を保持しつつ局所化精度を最適化するために、ImageNet事前学習とトラッキング固有のファインチューニングを統合する。
  • 共有重みを用いた微分可能アーキテクチャサーチを可能にするスーパーネットベースのサーチパイプラインを採用し、サーチコストを低減するとともに収束性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1ワンショットNASはオブジェクトトラッキングに効果的に適応可能であり、軽量で高性能なアーキテクチャを自動で発見できるか?
  • RQ2NASで同定されたトラッカーの性能は、手作業で設計されたSOTAトラッカーと比較して、精度と効率の面で優れているか?
  • RQ3ImageNet事前学習は、探索されたアーキテクチャの最終的なトラッキング性能にどの程度向上効果をもたらすか?
  • RQ4オブジェクトトラッキングの文脈においてNASから得られるアーキテクチャパターンは何か?また、既知の設計原則と整合性があるか?
  • RQ5探索されたトラッカーは、モバイルおよびエッジハードウェア上でリアルタイム推論を達成できるか? その際、競争力のある精度を維持できるか?

主な発見

  • LightTrackは、VOT-19ベンチマークで530M FLOPsのトラッカーを発見し、EAOが0.333に達する。これはSiamRPN++(0.287)を4.6%上回り、FLOPsは98.9%削減された。
  • Snapdragon 845 Adreno 630 GPU上では、LightTrackはOcean(38.4 fps)よりも12倍速く(3.2 fps)、パラメータ数が13倍少ない(1.97M vs. 25.9M)、FLOPsが38倍少ない(530M vs. 20.3G)。
  • ImageNet事前学習はトラッキング性能を顕著に向上させる:事前学習なしではEAOが21.3%、500エポックの事前学習では33.3%に向上する。
  • 探索されたバックボーンでは約50%のブロックに7×7 MBConvブロックが使用されており、広い受容 field が局所化精度に有益であることが示唆される。
  • 最適な特徴出力層は最終から2番目のブロックである。これは、トラッキングネットワークが高レベル表現よりも中レベル特徴を活用することで利益を得られることを示唆している。
  • 分類ブランチは回帰ブランチよりも浅く、粗い局所化と正確なバウンディングボックス回帰の難易度の差を反映している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。