Skip to main content
QUICK REVIEW

[論文レビュー] Re-ID Driven Localization Refinement for Person Search

Chuchu Han, Jiacheng Ye|arXiv (Cornell University)|Sep 18, 2019
Video Surveillance and Tracking Methods参考文献 37被引用数 4
ひとこと要約

本稿では、エンドツーエンドのre-ID駆動型局所化精錬フレームワークを提案する。このフレームワークは、微分可能ROI変換層を通じてre-ID損失によって検出器のボックス座標を監視することで、歩行者検出とperson re-identificationを同時に最適化する。本手法は、背景ノイズを低減し、特徴的属性を保持するようにボックスを精錬することで検出品質を向上させ、CUHK-SYSUで93.0%、PRWで42.9%のSOTA mAPを達成した。

ABSTRACT

Person search aims at localizing and identifying a query person from a gallery of uncropped scene images. Different from person re-identification (re-ID), its performance also depends on the localization accuracy of a pedestrian detector. The state-of-the-art methods train the detector individually, and the detected bounding boxes may be sub-optimal for the following re-ID task. To alleviate this issue, we propose a re-ID driven localization refinement framework for providing the refined detection boxes for person search. Specifically, we develop a differentiable ROI transform layer to effectively transform the bounding boxes from the original images. Thus, the box coordinates can be supervised by the re-ID training other than the original detection task. With this supervision, the detector can generate more reliable bounding boxes, and the downstream re-ID model can produce more discriminative embeddings based on the refined person localizations. Extensive experimental results on the widely used benchmarks demonstrate that our proposed method performs favorably against the state-of-the-art person search methods.

研究の動機と目的

  • person searchにおけるperson re-identificationのための最適でない境界ボックスを生じる独立して訓練された検出器の限界を解決する。
  • 検出器の監視を下流のre-IDタスクに合わせることで、局所化精度を向上させる。
  • ROIクロッピング処理を微分可能にすることで、検出とre-IDのエンドツーエンド最適化を可能にする。
  • 標準的なトリプレットが不適切なperson searchパイプラインにおいて、ハードネガティブサンプルのマイニングを可能にするプロキシトリプレット損失を提案する。
  • 複数の検出器とデータセット、特に大規模ギャラリー設定においても、強力な性能向上を示す。

提案手法

  • 検出された境界ボックスを元の画像からアフィン変換ベースのクロッピングを行う微分可能ROI変換層を導入し、ボックス座標への勾配伝搬を可能にする。
  • 検出器のボックス座標を、回帰損失に依存するのではなく、re-IDモデルの損失によって監視することで、検出をre-IDの目的に合わせる。
  • 検出器とre-IDモデルをエンドツーエンドで同時に学習させ、より特徴的でノイズの少ない境界ボックスを学習可能にする。
  • person searchではハードネガティブが定義しづらいことから、標準的なトリプレットマイニングが不適切である問題を解決するため、プロキシトリプレット損失を提案する。
  • 精錬された検出ボックスをre-IDパイプラインに統合し、バッグやシューズといった重要な特徴を強調することで、特徴埋め込みを向上させる。
  • Faster R-CNNとRetinaNetの両方の検出器に本フレームワークを適用し、検出器アーキテクチャにわたる汎用性を実証する。

実験結果

リサーチクエスチョン

  • RQ1re-ID損失を微分可能かつエンドツーエンドの方法で歩行者検出ボックスの精錬に効果的に利用できるか?
  • RQ2標準的な検出学習と比較して、re-ID駆動型監視は局所化品質をどのように向上させるか?
  • RQ3提案されたプロキシトリプレット損失は、person searchにおけるハードサンプルマイニングをどの程度改善するか?
  • RQ4本フレームワークは、異なる検出器アーキテクチャやギャラリーのサイズに一般化可能か?
  • RQ5本手法は、CUHK-SYSUやPRWといった大規模ベンチマークでSOTAのperson search手法を上回ることができるか?

主な発見

  • 提案手法はCUHK-SYSUベンチマークで93.0%のmAPを達成し、SOTA手法を大きく上回った。
  • PRWデータセットでは42.9%のmAPを達成し、大規模でオープンワールドなperson searchにおいて強力な性能を示した。
  • ベースラインが93.24%のRank-1と92.23%のmAPであるのに対し、分類損失とプロキシトリプレット損失を組み合わせることで、94.24%のRank-1と93.09%のmAPに向上した。
  • Faster R-CNNに適用するとRank-1が1.0%、mAPが0.86%向上し、RetinaNetに適用するとRank-1が1.76%、mAPが0.94%向上した。
  • 可視化結果から、精錬されたボックスは不要な人物や背景を除去しながら、バッグやシューズといった重要な属性を保持していることが明らかになった。
  • 本手法は、すべてのギャラリーのサイズでベースラインを常に上回り、特に大規模な設定において顕著なスケーラビリティとロバストネスを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。