Skip to main content
QUICK REVIEW

[論文レビュー] Densely Semantically Aligned Person Re-Identification

Zhizheng Zhang, Cuiling Lan|arXiv (Cornell University)|Dec 21, 2018
Video Surveillance and Tracking Methods参考文献 54被引用数 18
ひとこと要約

本稿では、DensePoseからの密なセマンティックマッピングを用いて24枚の密にアラインされた部分画像(DSAP画像)を生成する、密にセマンティック的にアラインされた人物再識別フレームワークを提案する。これにより、ポーズや視点の変化に対しても細分化された空間的・セマンティック的アラインメントが可能になる。2ストリームネットワークは、主なフル画像ストリームにおける特徴学習を調整するためのガイドストリームとしてDSAP画像を用いる。推論時にはガイドストリームを廃棄することで効率性を保ちつつ、最先端の性能を達成:Market1501では95.7%のrank-1、CUHK01では90.4%、CUHK03では新しいプロトコル下で78.9%のrank-1を達成。

ABSTRACT

We propose a densely semantically aligned person re-identification framework. It fundamentally addresses the body misalignment problem caused by pose/viewpoint variations, imperfect person detection, occlusion, etc. By leveraging the estimation of the dense semantics of a person image, we construct a set of densely semantically aligned part images (DSAP-images), where the same spatial positions have the same semantics across different images. We design a two-stream network that consists of a main full image stream (MF-Stream) and a densely semantically-aligned guiding stream (DSAG-Stream). The DSAG-Stream, with the DSAP-images as input, acts as a regulator to guide the MF-Stream to learn densely semantically aligned features from the original image. In the inference, the DSAG-Stream is discarded and only the MF-Stream is needed, which makes the inference system computationally efficient and robust. To the best of our knowledge, we are the first to make use of fine grained semantics to address the misalignment problems for re-ID. Our method achieves rank-1 accuracy of 78.9% (new protocol) on the CUHK03 dataset, 90.4% on the CUHK01 dataset, and 95.7% on the Market1501 dataset, outperforming state-of-the-art methods.

研究の動機と目的

  • ポーズ、視点、遮蔽、検出エラーによって引き起こされる継続的なボディの不一致問題に対処すること。
  • 密な3次元表面対応(UVマップ)を用いて、ピクセル単位のセマンティックラベル付けを可能にする、細分化されたピクセルレベルのセマンティックアラインメントを実現すること。
  • 主なストリームにおける特徴学習を向上させるために、アラインされた部分画像に基づくガイドストリームを備えた2ストリームネットワークを設計し、推論効率に影響を与えないこと。
  • 標準ベンチマークで最先端の性能を達成するとともに、実装時の計算効率を維持すること。

提案手法

  • 各人物画像に対してDensePoseを用いて、密な2次元から3次元の表面対応(UV座標)を推定し、ピクセル単位での細分化されたセマンティックラベル付けを可能にする。
  • 元の画像を標準的なUV空間にワープすることで、24枚の密にセマンティック的にアラインされた部分画像(DSAP画像)を生成し、画像間での空間的・セマンティック的整合性を保証する。
  • 2ストリームネットワークを設計:主なフル画像ストリーム(MF-ストリーム)は主な特徴学習を担当し、密にセマンティック的にアラインされたガイドストリーム(DSAG-ストリーム)はDSAP画像を用いてMF-ストリームの学習を監視・制御する。
  • トレーニング中はMF-ストリームとDSAG-ストリームの特徴を要素ごとの加算で融合し、推論時にはDSAG-ストリームを廃棄することで効率性を維持する。
  • 両ストリームにおいてグローバルおよび部分に注意を向けるブランチを共同で学習させ、相補的な特徴学習と耐障害性を向上させる。
  • グローバルおよびローカルブランチを備えたマルチスケール特徴学習戦略を採用し、識別能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1UV空間へのワープを用いた人物画像の密なセマンティックアラインメントが、ポーズや視点の変化に起因する不一致問題を顕著に軽減できるか?
  • RQ2密にアラインされた部分画像に基づくガイドストリームが、フル画像から学習される特徴の質と耐障害性を向上させられるか?
  • RQ3推論時にガイドストリームを廃棄する2ストリームアーキテクチャが、高い精度を維持しながら計算効率を向上させられるか?
  • RQ4粗い部分ベースのアラインメントと比較して、密なセマンティックアラインメントは再識別性能にどのように寄与するか?

主な発見

  • 提案手法はMarket1501データセットで95.7%のrank-1精度を達成し、従来の最先端手法を上回った。
  • CUHK01データセットでは90.4%のrank-1精度を達成し、困難で多様性のあるベンチマークでも強力な性能を示した。
  • 新しいプロトコル下のCUHK03データセットでは78.9%のrank-1精度を達成し、以前の手法より少なくとも10.9ポイントのrank-1精度向上を達成した。
  • アブレーションスタディの結果、粗いアラインメントと比較して密なセマンティックアラインメントが+1.6%のrank-1精度向上をもたらすことが確認され、細分化されたアラインメントの利点が明確になった。
  • ストリーム間の要素ごとの加算融合は、Market1501で87.6%のmAPと95.7%のrank-1を達成し、連結ベースの融合(81.6% mAP)を著しく上回った。
  • グローバルおよび部分に注意を向けるブランチを両方備えた完全なモデルが最高の性能を示し、相補的な特徴学習が再識別精度の向上に寄与することを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。