Skip to main content
QUICK REVIEW

[論文レビュー] CGUA: Context-Guided and Unpaired-Assisted Weakly Supervised Person Search

Chengyou Jia, Minnan Luo|arXiv (Cornell University)|Mar 27, 2022
Video Surveillance and Tracking Methods被引用数 7
ひとこと要約

CGUAは、人間によるIDアノテーションを一切使用せずに、文脈誘導型クラスタリングとペア化されていない人物を認識するメモリを活用することで、性能を向上させる画期的な弱教師付き人物検索フレームワークを提案する。シーンの文脈を統合し、二重のメモリバンクを用いてペア化されていない人物を区別することで、CGUAはSOTAの結果を達成し、CUHK-SYSUで先行する弱教師付き手法を5%以上のmAPで上回り、ボクシングボックスアノテーションのみで教師あり手法と同等の性能を達成した。

ABSTRACT

Recently, weakly supervised person search is proposed to discard human-annotated identities and train the model with only bounding box annotations. A natural way to solve this problem is to separate it into detection and unsupervised re-identification (Re-ID) steps. However, in this way, two important clues in unconstrained scene images are ignored. On the one hand, existing unsupervised Re-ID models only leverage cropped images from scene images but ignore its rich context information. On the other hand, there are numerous unpaired persons in real-world scene images. Directly dealing with them as independent identities leads to the long-tail effect, while completely discarding them can result in serious information loss. In light of these challenges, we introduce a Context-Guided and Unpaired-Assisted (CGUA) weakly supervised person search framework. Specifically, we propose a novel Context-Guided Cluster (CGC) algorithm to leverage context information in the clustering process and an Unpaired-Assisted Memory (UAM) unit to distinguish unpaired and paired persons by pushing them away. Extensive experiments demonstrate that the proposed approach can surpass the state-of-the-art weakly supervised methods by a large margin (more than 5% mAP on CUHK-SYSU). Moreover, our method achieves comparable or better performance to the state-of-the-art supervised methods by leveraging more diverse unlabeled data. Codes and models will be released soon.

研究の動機と目的

  • 既存の弱教師付き人物検索手法がシーンの文脈やペア化されていない人物を無視するという限界を是正すること。
  • 高価な人間によるIDアノテーションに依存を減らし、ボクシングボックスアノテーションのみで学習すること。
  • 文脈的およびペア化されていない人物の情報を統合することで、クラスタリングおよび再識別性能を向上させること。
  • 弱教師付きデータのみで教師あり手法と同等の性能を達成すること。

提案手法

  • 視覚的および文脈的類似性を組み合わせることで、クラスタリングのロバスト性を向上させる文脈誘導型クラスタリング(CGC)アルゴリズムを導入する。
  • 視覚的類似性とシーンの文脈を組み合わせたハイブリッド類似性を用いてクラスタリングをガイドし、ノイズの多いクラスタをフィルタリングするための制約を適用する。
  • ペア化された特徴とペア化されていない特徴の両方を格納するメモリバンクを備えた、ペア化された人物を支援するメモリ(UAM)ユニットを提案する。
  • 物体検出の後に文脈に配慮し、ペア化されていない人物に配慮したRe-IDを実行する二段階パイプラインを採用することで、特徴学習を向上させる。
  • ペア化されていない人物や完全なシーン画像を含む多様なラベルなしデータを活用し、モデルの一般化性能を向上させる。
  • t-SNE可視化を用いて、CGCおよびUAMによる特徴の凝縮性と分離性の向上を検証する。

実験結果

リサーチクエスチョン

  • RQ1完全なシーン画像に含まれる文脈情報は、弱教師付き人物検索でどのように効果的に活用できるか?
  • RQ2データセットに一度しか現れないペア化されていない人物が、クラスタリングおよびRe-ID性能に与える影響は何か?
  • RQ3二重のメモリバンク機構は、ペア化された人物とペア化されていない人物の区別を向上させられるか?
  • RQ4ボクシングボックスアノテーションのみで、弱教師付きモデルがどの程度教師ありモデルの性能に近づけるか?
  • RQ5文脈情報とペア化されていない人物に配慮したアプローチの統合は、クラスタリングの品質および特徴の識別性にどのように影響を与えるか?

主な発見

  • CGUAはCUHK-SYSUデータセットでトップ1正答率92.0%、mAP 91.0%を達成し、SOTAの弱教師付き手法をmAP 5%以上上回った。
  • PRWデータセットでは、CGUAはトップ1正答率86.9%を達成し、既存の弱教師付き手法を上回り、教師ありSOTAの結果と同等だった。
  • CGCアルゴリズムは、ベースラインのFINCHクラスタリング手法と比較して、CUHK-SYSUでmAPが12%以上、PRWで5%以上向上した。
  • UAMユニットは、ペア化されていない人物とペア化された人物の間の混同を顕著に低減した。定性的な結果では、最終モデルがクエリを正しく特定し、誤検出を回避していることが示された。
  • ペア化されていない人物や完全なシーン画像を含む多様なラベルなしデータを活用することで、CGUAは教師あり手法と同等の性能を達成した。
  • 実行時間解析により、CGUAは一発型手法と同等の効率性(V100で68ms)を示しており、二段階設計にもかかわらず高い実用性を有していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。