Skip to main content
QUICK REVIEW

[論文レビュー] Video-based Person Re-identification via 3D Convolutional Networks and Non-local Attention

Xingyu Liao, Lingxiao He|arXiv (Cornell University)|Jul 12, 2018
Video Surveillance and Tracking Methods参考文献 51被引用数 5
ひとこと要約

本稿では、3次元畳み込みニューラルネットワークに非局所注意ブロックを組み合わせた手法を提案する。この手法により、空間的・時間的依存関係の統合的モデリングと空間的不一致の処理が可能となり、MARSデータセットにおいて前人最高の性能を達成。PRID2011およびiLIDS-VIDでも既存手法を上回る性能を示した。

ABSTRACT

Video-based person re-identification (ReID) is a challenging problem, where some video tracks of people across non-overlapping cameras are available for matching. Feature aggregation from a video track is a key step for video-based person ReID. Many existing methods tackle this problem by average/maximum temporal pooling or RNNs with attention. However, these methods cannot deal with temporal dependency and spatial misalignment problems at the same time. We are inspired by video action recognition that involves the identification of different actions from video tracks. Firstly, we use 3D convolutions on video volume, instead of using 2D convolutions across frames, to extract spatial and temporal features simultaneously. Secondly, we use a non-local block to tackle the misalignment problem and capture spatial-temporal long-range dependencies. As a result, the network can learn useful spatial-temporal information as a weighted sum of the features in all space and temporal positions in the input feature map. Experimental results on three datasets show that our framework outperforms state-of-the-art approaches by a large margin on multiple metrics.

研究の動機と目的

  • 動画ベースの人物再識別における時間的依存関係と空間的不一致の課題に対処する。
  • 長距離の空間的・時間的関係を捉えることで、動画シーケンス全体での特徴集約を向上させる。
  • 平均/最大プーリングやRNNベースの手法に見られる限界を克服し、時間的ダイナミクスと空間的不一致を同時にモデル化できない問題を解決する。
  • 空間的・時間的注意を統合したエンドツーエンドの3次元CNNフレームワークを構築し、判別性の高い表現学習を実現する。
  • 遮蔽や視点変化などの多様な現実世界の条件下でも優れた性能を示すことを実証する。

提案手法

  • 動画ボリュームから直接、空間的・時間的特徴を抽出するために3次元畳み込みネットワークを採用し、フレーム間の2次元畳み込みを置き換える。
  • 非局所ブロックを統合して、空間的・時間的全域における長距離依存関係を明示的にモデル化し、すべての位置からの特徴を重み付きで集約可能にする。
  • 非局所ブロックを空間的・時間的注意機構として用い、変形や遮蔽が生じたフレームにおける不一致を軽減する。
  • 動画トラックペアを用いた三重項損失と自己教師付き対照学習を組み合わせて、エンドツーエンドのモデルを訓練する。
  • Kineticsデータセットで3D ResNet3D-50バックボーンを事前学習し、ImageNet やReID特化データセットよりも優れた初期化を実現する。
  • 特徴正規化とメトリクス学習を適用し、最終的な埋め込み表現の判別力を強化する。

実験結果

リサーチクエスチョン

  • RQ12次元CNNに再帰的プーリングを適用する手法と比較して、3次元畳み込みネットワークは動画ReIDのための統合的空間的・時間的表現を効果的に学習できるか?
  • RQ2非局所ブロックは、動画シーケンスにおける長距離依存関係のモデル化と空間的不一致の処理によって、性能をどのように向上させるか?
  • RQ3非局所注意を統合したエンドツーエンドの3次元CNNは、分離された注意モジュールやRNNモジュールを用いる既存手法を上回る性能を発揮するか?
  • RQ4動画アクション認識データセット(例:Kinetics)での事前学習は、人物ReIDにおける一般化性能をどの程度向上させるか?
  • RQ5本手法は、遮蔽、視点変化、背景のごみなどの困難な条件下でも、どの程度の性能を示すか?

主な発見

  • MARSデータセットでは、本手法が91.2%のランク1精度と77.0%のmAPを達成し、前回SOTAの82.3% mAPを2.0ポイント上回った。
  • PRID2011では91.2%のランク1精度を達成し、前回SOTAの93.2%をわずかに下回るが、より効率的かつエンドツーエンドのアーキテクチャを実現している。
  • iLIDS-VIDでは81.3%のランク1精度を達成し、前回SOTAの80.2%を上回り、優れた一般化性能を示した。
  • Kineticsで事前学習すると、MARSにおけるmAPが84.3%に上昇し、ImageNet やReID特化データセットでの事前学習を大きく上回った。
  • アブレーションスタディにより、ResNet3D-50に非局所ブロックを組み込むことで、MARSでの性能が80.0%から84.3%に向上したことが確認され、非局所注意の有効性が裏付けられた。
  • 非局所ブロックは空間的不一致を効果的に軽減し、特に遮蔽や変形が生じる状況下でも特徴集約を強化した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。