Skip to main content
QUICK REVIEW

[論文レビュー] Keypoint Message Passing for Video-based Person Re-Identification

Di Chen, Andreas Doering|arXiv (Cornell University)|Nov 16, 2021
Video Surveillance and Tracking Methods被引用数 4
ひとこと要約

本論文は、畳み込みニューラルネットワーク(CNN)ベースの動画再識別において、人体キーポints特徴をグラフ畳み込みネットワーク(GCNs)を用いて活用することで、性能を向上させるグラフベースのメッセージパッシングフレームワーク、KMPNetを提案する。キーポイントからの空間的・時間的メッセージパッシングを訓練時に実行しつつ、推論時にはGCNブランチを削除することで、MARSおよびPoseTrackReIDで最先端の性能を達成し、特にPCBベースライン比でMARSで+3.3 ppのトップ1正答率向上を達成した。

ABSTRACT

Video-based person re-identification (re-ID) is an important technique in visual surveillance systems which aims to match video snippets of people captured by different cameras. Existing methods are mostly based on convolutional neural networks (CNNs), whose building blocks either process local neighbor pixels at a time, or, when 3D convolutions are used to model temporal information, suffer from the misalignment problem caused by person movement. In this paper, we propose to overcome the limitations of normal convolutions with a human-oriented graph method. Specifically, features located at person joint keypoints are extracted and connected as a spatial-temporal graph. These keypoint features are then updated by message passing from their connected nodes with a graph convolutional network (GCN). During training, the GCN can be attached to any CNN-based person re-ID model to assist representation learning on feature maps, whilst it can be dropped after training for better inference speed. Our method brings significant improvements over the CNN-based baseline model on the MARS dataset with generated person keypoints and a newly annotated dataset: PoseTrackReID. It also defines a new state-of-the-art method in terms of top-1 accuracy and mean average precision in comparison to prior works.

研究の動機と目的

  • 2Dおよび3D畳み込みの限界、特に人物の動きに起因する空間的局所性と時間的ずれの問題を解消する。
  • 人物関節のキーポイントから得られる非局所的かつ人間中心の空間的・時間的情報を統合することで、CNNベースの再識別モデルにおける表現学習を向上させる。
  • 推論時に効率を保つために、訓練時にのみ使用され、その後削除可能なグラフィカルブランチを設計する。
  • 動画再識別用に、人物IDとキーポイントアノテーションを両方備えた新しいベンチマークデータセットPoseTrackReIDを導入する。
  • 標準的な再識別ベンチマークにおいて、トップ1正答率および平均平均精度(mAP)で最先端の性能を達成する。

提案手法

  • 人体の関節位置におけるCNN特徴マップからキーポイント特徴を抽出し、空間的・時間的グラフのノードとして構築する。
  • グラフ畳み込みネットワーク(GCNs)が空間的および時間的につながったキーポイント間でメッセージパッシングを実行し、非局所的かつ時間的に整合した特徴集約を可能にする。
  • GCNブランチは、バックプロパゲーションを通じてCNNにフィードバック信号を提供する並列な訓練ブランチとして機能し、推論ネットワークを変更せずに特徴学習を向上させる。
  • 訓練後、キーポイント検出およびグラフ構造を含むGCNブランチ全体が削除され、推論にはCNNのみが残るため、速度と効率が保証される。
  • 本手法は汎用的であり、PCBなど、任意のCNNベースの再識別モデルにアーキテクチャの変更なしに組み込むことができる。
  • 本アプローチはキーポイントメッセージパッシング(KMP)と命名され、全体のモデルはKMPNetと呼ばれる。

実験結果

リサーチクエスチョン

  • RQ1人体キーポイントからのグラフベースのメッセージパッシングは、局所的畳み込みの限界を超えて、CNNベースの動画再識別を向上させることができるか?
  • RQ2キーポイントからの空間的および時間的メッセージパッシングを併用することで、単独で使用する場合よりも優れた表現学習が達成できるか?
  • RQ3推論時に効果的にグラフィカルブランチを削除しても性能が低下しないか? これにより、効率的なデプロイメントが可能か?
  • RQ4トップ1正答率および平均平均精度の観点で、本手法は最先端の再識別モデルと比較してどのように優れているか?
  • RQ5GCNガイドド訓練により、特に受容場域が小さい初期層において、特徴マップの判別力がどの程度向上するか?

主な発見

  • KMPNetはMARSデータセットでトップ1正答率93.0%、mAP90.4%を達成し、新たな最先端性能を樹立した。
  • MARSデータセットにおいて、空間的メッセージパッシングを用いることで、PCBベースライン比でトップ1正答率が+3.3 pp、mAPが+0.9 pp向上した。
  • 時間的メッセージパッシングのみを用いることで、PCBベースライン比でトップ1正答率が+3.4 pp、mAPが+0.7 pp向上した。
  • 空間的および時間的メッセージパッシングの組み合わせが最良の性能を示し、単独で使用する場合を上回った。
  • GCN処理済み埋め込み(x_g)はCNN埋め込み(x_c)ほど判別力が高くないため、推論時にGCNブランチを削除することが正当化される。
  • アブレーションスタディにより、性能向上はグラフベースのメッセージパッシングに起因しており、長時間訓練されたベースライン(GCNブランチなし)では向上が見られなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。