Skip to main content
QUICK REVIEW

[論文レビュー] BiCnet-TKS: Learning Efficient Spatial-Temporal Representation for Video Person Re-Identification

Ruibing Hou, Hong Chang|arXiv (Cornell University)|Apr 30, 2021
Video Surveillance and Tracking Methods参考文献 50被引用数 5
ひとこと要約

本稿では、空間的および時間的表現を統合的にモデル化する計算効率の高いアーキテクチャであるBiCnet-TKSを提案する。空間的特徴を複数のフレームにわたり多様に捉えるために、詳細とコンテキストの2本のブランチを持つ二重補完ネットワーク(BiCnet)を採用し、短時間および長時間の時間的特徴を適応的に融合する時間的カーネル選択(TKS)ブロックを組み合わせることで、先行手法と比較して約50%の計算量削減を達成しながら最先端の性能を実現した。

ABSTRACT

In this paper, we present an efficient spatial-temporal representation for video person re-identification (reID). Firstly, we propose a Bilateral Complementary Network (BiCnet) for spatial complementarity modeling. Specifically, BiCnet contains two branches. Detail Branch processes frames at original resolution to preserve the detailed visual clues, and Context Branch with a down-sampling strategy is employed to capture long-range contexts. On each branch, BiCnet appends multiple parallel and diverse attention modules to discover divergent body parts for consecutive frames, so as to obtain an integral characteristic of target identity. Furthermore, a Temporal Kernel Selection (TKS) block is designed to capture short-term as well as long-term temporal relations by an adaptive mode. TKS can be inserted into BiCnet at any depth to construct BiCnetTKS for spatial-temporal modeling. Experimental results on multiple benchmarks show that BiCnet-TKS outperforms state-of-the-arts with about 50% less computations. The source code is available at https://github.com/ blue-blue272/BiCnet-TKS.

研究の動機と目的

  • 動画シーケンスからの空間的および時間的手がかりを十分に活用できない既存の動画re-ID手法の限界を解消すること。
  • 効率的なアーキテクチャの設計により、再識別精度を維持または向上させながら計算コストを低減すること。
  • 動画のコンテンツ特性に基づいて、短時間および長時間の時間的依存関係を適応的にモデル化すること。
  • 異なるボディパーツに注目させる注目モジュールの促進により、フレーム間での特徴の多様性を向上させること。
  • 既存のネットワークに容易に組み込める軽量で再利用可能なコンponents(TKS)を設計し、効果的な時間的モデリングを可能とすること。

提案手法

  • BiCnetは2つの並列ブランチを採用する:入力フレームを元解像度で処理する詳細ブランチ(細部の視覚的詳細を保持)、ダウンサンプリングを用いて受容 field を拡大するコンテキストブランチ(長距離コンテキストモデリングに適応)。
  • 各ブランチに、複数の並列で多様な空間的注目モジュールを適用し、連続するフレーム間で異なるボディパーツに注目させることで、空間的補完性を高める。
  • 時間的カーネル選択(TKS)ブロックは、時間方向に異なるカーネルサイズ(例:3, 5, 7)を有する複数の並列3次元畳み込みパスを用い、短時間および長時間の動きパターンを捉える。
  • TKSはグローバル特徴情報に基づいて最も関連性の高い時間的カーネルを選択するため、固定された重みによる融合なしに動的時間モデリングを実現する。
  • TKSブロックは軽量であり、BiCnetの任意の段階に挿入可能で、段階的な空間的・時間的特徴学習が可能なBiCnet-TKSアーキテクチャを形成する。
  • 両ブランチからの特徴マップを集約し、TKSによる時間的モデリングの前に包括的な空間的表現を形成する。
Figure 1: An example of class activation maps [ 53 ] of a pair of input video sequences of existing method [ 50 ] and our method.
Figure 1: An example of class activation maps [ 53 ] of a pair of input video sequences of existing method [ 50 ] and our method.

実験結果

リサーチクエスチョン

  • RQ1補完的な空間的ブランチを持つ二重ブランチネットワークは、動画re-IDにおける特徴の多様性とアイデンティティ表現を向上させることができるか?
  • RQ2複数の時間的カーネルサイズの適応的選択は、動画シーケンスにおける短時間および長時間の動きパターンのモデリングを向上させることができるか?
  • RQ3提案されたTKSブロックは、マルチスケール時間特徴の固定重み融合と比較して、性能を向上させつつ計算コストを低く保てるか?
  • RQ4ネットワークアーキテクチャ内でTKSブロックをどの位置に配置するのが、最大の性能向上をもたらすか?
  • RQ5BiCnetとTKSの組み合わせにより、顕著にFLOPsを削減した状態で最先端の精度を達成できるか?

主な発見

  • BiCnet-TKSはMARSベンチマークで86.0%のmAPおよび90.2%のトップ-1精度を達成し、最先端の手法を上回った。
  • モデルに必要な計算量は1.99 GFLOPsであり、先行SOTAモデルと比較して約50%の計算量削減を達成した。
  • BiCnetのステージ2の後にTKSブロックを追加すると、パラメータ数およびFLOPsの増加は最小限に抑えられつつ、mAPとトップ-1精度がそれぞれ0.4%向上した。
  • TKSにおける適応的選択メカニズムは不可欠であることが示された—単純な平均化(TKブロック)では性能向上が得られず、動的カーネル選択の価値が裏付けられた。
  • ステージ1またはステージ4にTKSを配置すると性能が低下するため、時間的モデリングにはステージ2および3が最適であることが示された。
  • 3つの時間的カーネル(K3, K5, K7)を用いるよりも2つのカーネルで十分であり、2つのカーネルで十分に重要な時間的ダイナミクスを捉えることができた。
Figure 2: Short and long-term temporal relations have varying importance for different sequences. (a) A sequence with partial occlusion. The long-term temporal clues are desired to alleviate occlusion. (b) A sequence of a fast-moving pedestrian. The short-term temporal clues are desired to model det
Figure 2: Short and long-term temporal relations have varying importance for different sequences. (a) A sequence with partial occlusion. The long-term temporal clues are desired to alleviate occlusion. (b) A sequence of a fast-moving pedestrian. The short-term temporal clues are desired to model det

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。