Skip to main content
QUICK REVIEW

[論文レビュー] Learning Context Graph for Person Search

Yichao Yan, Qiang Zhang|arXiv (Cornell University)|Apr 3, 2019
Video Surveillance and Tracking Methods参考文献 50被引用数 8
ひとこと要約

本稿では、シーン内の歩行者同士の文脈的関係を学習することで特徴の識別性を向上させる文脈に配慮したフレームワークを提案する。共乗者からの有益な文脈をフィルタリングする相対的アテンションモジュールと、プローブ・ギャラリー対全体の類似度を統合するグラフ学習機構を導入し、CUHK-SYSU(86.5% top-1、84.1% mAP)およびPRW(73.6% top-1、33.4% mAP)で最先端の性能を達成した。

ABSTRACT

Person re-identification has achieved great progress with deep convolutional neural networks. However, most previous methods focus on learning individual appearance feature embedding, and it is hard for the models to handle difficult situations with different illumination, large pose variance and occlusion. In this work, we take a step further and consider employing context information for person search. For a probe-gallery pair, we first propose a contextual instance expansion module, which employs a relative attention module to search and filter useful context information in the scene. We also build a graph learning framework to effectively employ context pairs to update target similarity. These two modules are built on top of a joint detection and instance feature learning framework, which improves the discriminativeness of the learned features. The proposed framework achieves state-of-the-art performance on two widely used person search datasets.

研究の動機と目的

  • 遮蔽、ポーズの変化、照明の変化といった困難な条件下で個々の外見特徴の限界を解消すること。
  • 正確な歩行者検出に依存しないように、文脈的情報を統合したエンドツーエンドの検出と特徴学習を実現すること。
  • 従来の方法がノイズや曖昧な個々の特徴のため性能が低下する大規模ギャラリー設定における耐性を高めること。
  • 手動アノテーションや複雑な社会的力モデルに依存せずに、隣接する歩行者からの関連する文脈的情報を学習可能でデータ駆動型の方法で特定・利用すること。
  • 文脈に配慮したグラフ構造を通じてグローバルな関係をモデル化することで、プローブとギャラリー対間の類似度推定を向上させること。

提案手法

  • ターゲットプローブの同じシーンに存在する全歩行者を文脈候補として収集する文脈的インスタンス拡張モジュールを提案する。
  • プローブとギャラリーの文脈候補間のアテンションスコアを計算することで、有益な文脈ペアを特定・フィルタリングする相対的アテンションモジュールを導入する。
  • ノードがターゲット人物およびその文脈ペアを表す文脈グラフを構築し、すべての文脈ノードをターゲットノードに接続するエッジを設ける。
  • 共有重みを用いてグラフを学習し、プローブ・ギャラリー対間のグローバル類似度を学習することで、文脈的情報を統合し、最終的な類似度スコアを精緻化する。
  • エンドツーエンド学習を可能にするために、共同検出とインスタンス特徴学習フレームワークに文脈グラフモジュールを統合する。
  • 2つの画像を比較するためのシアン方式のグラフ学習アーキテクチャを用い、両方のグラフに共有重みを適用することで一貫性のある特徴学習を保証する。

実験結果

リサーチクエスチョン

  • RQ1隣接する歩行者からの文脈的情報は、実世界の監視シナリオにおける人物再識別性能を向上させることができるか?
  • RQ2手動アノテーションに依存せずに、ノイズの多いシーン文脈から自動的に有用な文脈を同定・フィルタリングできるか?
  • RQ3グローバルな文脈的関係をモデル化する最適なグラフ構造は何か? これにより人物検索における類似度推定がどのように向上するか?
  • RQ4学習可能なグラフ機構を介して文脈を統合することで、大規模ギャラリー設定下での一般化性と耐性が向上するか?
  • RQ5多様なベンチマークにおいて、mAPおよびtop-1精度の観点から、本手法は最先端手法と比較してどのように差をつけるか?

主な発見

  • 提案手法は、CUHK-SYSUデータセットで86.5%のtop-1精度および84.1%のmAPを達成し、従来の最先端手法を上回った。
  • PRWデータセットでは、限られた学習データを有するにもかかわらず、73.6%のtop-1精度および33.4%のmAPを達成し、既存のSOTAアプローチを上回った。
  • ギャラリーのサイズが50から4000に変化する状況でも一貫した性能向上を示し、大規模設定下での耐性を裏付けた。
  • アブレーションスタディの結果、相対的アテンションモジュールが関連する文脈を効果的にフィルタリングし、ノイズを低減するとともに特徴の識別性を向上させた。
  • グラフベースの類似度学習フレームワークは、シアン方式のグラフ構造(DisGCN)を上回った。これは、ノード内関係モデリングが文脈表現を強化することを示している。
  • 異なるデータ分布を持つデータセット間でも良好な一般化性能を示したため、実世界の条件下でも強い一般化能力を有していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。