Skip to main content
QUICK REVIEW

[論文レビュー] SMILEtrack: SiMIlarity LEarning for Occlusion-Aware Multiple Object Tracking

Yu-Hsiang Wang, Jun-Wei Hsieh|arXiv (Cornell University)|Nov 16, 2022
Video Surveillance and Tracking Methods被引用数 10
ひとこと要約

SMILEtrack は、パッチ自己注意(Patch Self-Attention)を備えたシアンズ型ネットワークベースの類似度学習モジュール(SLM)と、GATE関数を有する類似度マッチングカスケード(SMC)を提案し、遮蔽や複雑なシーンにおける外見ベースのマッチングを向上させる。MOT17 および MOT20 において BYTETrack より 0.4–0.8 MOTA および 2.1–2.2 HOTA の向上を達成し、37.5 FPS の高速な推論速度を維持する最先端の性能を発揮する。

ABSTRACT

Despite recent progress in Multiple Object Tracking (MOT), several obstacles such as occlusions, similar objects, and complex scenes remain an open challenge. Meanwhile, a systematic study of the cost-performance tradeoff for the popular tracking-by-detection paradigm is still lacking. This paper introduces SMILEtrack, an innovative object tracker that effectively addresses these challenges by integrating an efficient object detector with a Siamese network-based Similarity Learning Module (SLM). The technical contributions of SMILETrack are twofold. First, we propose an SLM that calculates the appearance similarity between two objects, overcoming the limitations of feature descriptors in Separate Detection and Embedding (SDE) models. The SLM incorporates a Patch Self-Attention (PSA) block inspired by the vision Transformer, which generates reliable features for accurate similarity matching. Second, we develop a Similarity Matching Cascade (SMC) module with a novel GATE function for robust object matching across consecutive video frames, further enhancing MOT performance. Together, these innovations help SMILETrack achieve an improved trade-off between the cost ({\em e.g.}, running speed) and performance (e.g., tracking accuracy) over several existing state-of-the-art benchmarks, including the popular BYTETrack method. SMILETrack outperforms BYTETrack by 0.4-0.8 MOTA and 2.1-2.2 HOTA points on MOT17 and MOT20 datasets. Code is available at https://github.com/pingyang1117/SMILEtrack_Official

研究の動機と目的

  • 視認性の低い対象や類似した外見の対象が混在する複雑なシーンにおける、複数対象追跡(MOT)における遮蔽の持続的課題に対処すること。
  • 共同検出と埋め込み(JDE)モデルに比べて効率性に劣る分離検出と埋め込み(SDE)手法における、コストパフォーマンスのトレードオフを改善すること。
  • SDEモデルで一般的に用いられる従来の特徴記述子が、外見的に類似した対象を区別できないという限界を克服すること。
  • 推論速度を犠牲にせずに高い精度を実現する、耐障害性に優れた軽量な類似度マッチング機構の開発

提案手法

  • ビジョントランスフォーマーにインspiredされたパッチ自己注意(PSA)ブロックを用いた、シアンズ型ネットワークベースの類似度学習モジュール(SLM)を導入し、2つの対象候補間の外見的類似度を計算する。
  • 新たな GATE 関数を備えた類似度マッチングカスケード(SMC)モジュールを設計し、複数のフレームに跨る対象の関連付けを段階的に実行することで、遮蔽下でも耐障害性を向上させる。
  • 2段階のマッチング戦略を採用:第1段階では IOU と SLM に基づく外見的類似度を統合して高信頼度の検出結果を処理し、第2段階では低信頼度または遮蔽された対象に対しては IOU 基準に依存する。
  • 低検出スコアの対象に対する特徴表現を強化するため、SLM に複数のテンプレートを用いることで、困難な状況下でも耐障害性を向上させる。
  • アブレーションスタディを用いて PSA ブロック内のパッチレイアウトを最適化し、MOT17 および MOT20 で最適なパフォーマンスを発揮する type-E の構成を選定する。
  • SLM と SMC を検出に基づく追跡パイプラインに統合し、高い精度を維持しながらも、効率的な推論を可能にする。

実験結果

リサーチクエスチョン

  • RQ1自己注意を備えたシアンズ型類似度学習モジュールは、従来の特徴記述子と比較して、遮蔽下のMOTシナリオにおける外見ベースのマッチングを向上させることができるか?
  • RQ2提案された GATE 関数を有する類似度マッチングカスケード(SMC)は、特に遮蔽状況下において、連続フレーム間の追跡の耐障害性をどのように向上させるか?
  • RQ3精度と効率のバランスを考慮した場合、多段階マッチングにおける IOU と外見的類似度の最適な組み合わせは何か?
  • RQ4SLM および SMC の各コンponents は、BYTETrack などの既存の SDE ベースのトラッカーの性能をどの程度向上させることができるか?
  • RQ5パッチ自己注意ブロック内のパッチレイアウトは、MOT における全体の類似度学習パフォーマンスにどのように影響を与えるか?

主な発見

  • SMILEtrack は、MOT17 テストセットで 37.5 FPS の速度で 80.7 MOTA および 65.0 HOTA を達成し、MOTA、IDF1、HOTA、FN、MT といった主要指標において、すべての最先端手法を上回る性能を発揮する。
  • MOT17 において、SMILEtrack は唯一、IDF1 スコアが 80 を超える手法であり、BYTETrack より 0.4–0.8 MOTA および 2.0 以上の HOTA ポints を上回る。
  • MOT20 において、SMILEtrack はすべての最先端手法の中で最高の MOTA、IDF1、HOTA、FN スコアを記録し、優れた汎化性能と耐障害性を示している。
  • アブレーションスタディの結果、PSA ブロックにおける type-E パッチレイアウトが最良のパフォーマンスを発揮し、他の構成と比較して MOTA を最大 0.3 ポイント向上させる。
  • SMC の両段階に SLM と IOU を組み合わせた構成が最良の結果をもたらし、最終的な設定では MOT17 で 76.5 MOTA および 78.9 IDF1 を達成する。
  • BYTETrack に SLM、SMC、GATE 要素を適用した場合、性能が顕著に向上し、既存の SDE トラッカーに統合可能な効果的なプラグインモジュールであることが実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。