Skip to main content
QUICK REVIEW

[論文レビュー] VRSTC: Occlusion-Free Video Person Re-Identification

Ruibing Hou, Bingpeng Ma|arXiv (Cornell University)|Jul 19, 2019
Video Surveillance and Tracking Methods参考文献 38被引用数 17
ひとこと要約

本稿では、部分的遮蔽に対処するために、遮蔽フレームからの欠損した身体部位を回復するための空間的・時間的補完ネットワーク(STCnet)を用いる、VRSTCと呼ばれる動画人物再識別フレームワークを提案する。STCnetは、空間的ボディ構造と時間的運動パターンを活用して、現実的な遮蔽領域を生成し、それらを可視部位と組み合わせて再識別精度を向上させる。MARS、DukeMTMC-VideoReID、iLIDS-VIDの3つのベンチマークで最先端性能を達成した。

ABSTRACT

Video person re-identification (re-ID) plays an important role in surveillance video analysis. However, the performance of video re-ID degenerates severely under partial occlusion. In this paper, we propose a novel network, called Spatio-Temporal Completion network (STCnet), to explicitly handle partial occlusion problem. Different from most previous works that discard the occluded frames, STCnet can recover the appearance of the occluded parts. For one thing, the spatial structure of a pedestrian frame can be used to predict the occluded body parts from the unoccluded body parts of this frame. For another, the temporal patterns of pedestrian sequence provide important clues to generate the contents of occluded parts. With the Spatio-temporal information, STCnet can recover the appearance for the occluded parts, which could be leveraged with those unoccluded parts for more accurate video re-ID. By combining a re-ID network with STCnet, a video re-ID framework robust to partial occlusion (VRSTC) is proposed. Experiments on three challenging video re-ID databases demonstrate that the proposed approach outperforms the state-of-the-art.

研究の動機と目的

  • 歩行者や環境的要因による部分的遮蔽によって引き起こされる動画人物再識別における顕著な性能低下を解消すること。
  • 従来の手法が遮蔽フレームを無視することで失われる貴重な空間的・時間的情報の制限を克服すること。
  • 空間的および時間的ヒントを用いて、遮蔽された身体部位の現実的な外観を回復する補完ネットワークの開発。
  • 完成されたフレームを再識別フレームワークに統合し、遮蔽下でも耐性と精度を向上させること。
  • DukeMTMC-VideoReIDで新たな最先端のベースラインを確立し、複数のベンチマークで一貫した性能向上を示すこと。

提案手法

  • 単一フレーム内での可視部位に基づいて遮蔽された身体部位を予測する空間的構造生成器を備えた二重ブランチネットワークであるSTCnetを提案。
  • 隣接フレームの時間的運動パターンを用いて、空間的に補完された特徴を精緻化する時間的アテンション生成器を導入。
  • 時間的特徴を重み付け・集約する新しい時間的アテンション層を採用し、回復された遮蔽領域の品質を向上。
  • 標準的な再識別ネットワークとSTCnetを組み合わせてVRSTCを構築。トレーニングおよび推論では遮蔽されていないフレームのみを用いるが、補完されたフレームが特徴学習を改善する。
  • 畳み込みニューラルネットワーク(CNN)による特徴抽出の後、時間的プーリングとアテンション機構を用いて、強力な動画レベルの表現を生成。
  • クロスエントロピー損失とトリプルット損失を用いて、エンドツーエンドで全体フレームワークを最適化し、人物再識別性能を向上。

実験結果

リサーチクエスチョン

  • RQ1空間的および時間的情報を用いて、深層学習モデルが動画フレーム内の遮蔽された身体部位の外観を効果的に回復できるか?
  • RQ2遮蔽領域を回復することで、それらのフレームを無視するのと比較して、部分的遮蔽下での人物再識別精度が向上するか?
  • RQ3補完ネットワークが光流などの追加入力なしに、再識別特徴の判別力を向上させられるか?
  • RQ4提案されたVRSTCフレームワークは、標準的な動画再識別ベンチマークでSOTA手法と比較してどのように性能を発揮するか?
  • RQ5補完されたフレームの統合が、特徴表現の質と遮蔽に対する耐性をどの程度向上させるか?

主な発見

  • MARSデータセットでは、VRSTCはランク-1精度88.5%、mAP 82.3%を達成し、以前のSOTA手法であるSnippet+OFをランク-1で2.2%、mAPで6.2%上回った。
  • DukeMTMC-VideoReIDでは、VRSTCはランク-1 95.0%、mAP 93.5%を達成し、ベースラインモデルをランク-1で7.8%、mAPで11.7%上回った。
  • iLIDS-VIDでは、VRSTCはランク-1 83.4%、ランク-20 99.5%を達成し、光流を用いないSnippetをランク-1で3.6%、ランク-20で3.7%上回った。
  • 可視化結果から、STCnetが遮蔽された身体部位を効果的に回復しており、特徴マップにおける背景や他の歩行者の干渉が低減されていることが確認された。
  • アブレーションスタディの結果、STCnetの空間的および時間的モジュールの両方が不可欠であることが示され、時間的モジュールが空間的補完のみに比べて顕著な向上をもたらした。
  • 光流に依存しない点で、一部のSOTA手法とは異なり、実世界への展開においてより実用的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。