Skip to main content
QUICK REVIEW

[論文レビュー] DSSL: Deep Surroundings-person Separation Learning for Text-based Person Retrieval

Aichun Zhu, Zijie Wang|arXiv (Cornell University)|Sep 12, 2021
Video Surveillance and Tracking Methods参考文献 31被引用数 11
ひとこと要約

本稿では、相互排他的制約を用いて人物固有の特徴と周囲のシーン情報を明示的に分離する、テキストベースの人物検索のための新しい深層学習フレームワークDSSLを提案する。5つのアライメントパラダイムと信号ノイズ除去モジュールを活用することで、DSSLはCUHK-PEDESで最先端性能を達成し、今後の研究のための新しいリアルワールドベンチマークRSTPReidを導入した。

ABSTRACT

Many previous methods on text-based person retrieval tasks are devoted to learning a latent common space mapping, with the purpose of extracting modality-invariant features from both visual and textual modality. Nevertheless, due to the complexity of high-dimensional data, the unconstrained mapping paradigms are not able to properly catch discriminative clues about the corresponding person while drop the misaligned information. Intuitively, the information contained in visual data can be divided into person information (PI) and surroundings information (SI), which are mutually exclusive from each other. To this end, we propose a novel Deep Surroundings-person Separation Learning (DSSL) model in this paper to effectively extract and match person information, and hence achieve a superior retrieval accuracy. A surroundings-person separation and fusion mechanism plays the key role to realize an accurate and effective surroundings-person separation under a mutually exclusion constraint. In order to adequately utilize multi-modal and multi-granular information for a higher retrieval accuracy, five diverse alignment paradigms are adopted. Extensive experiments are carried out to evaluate the proposed DSSL on CUHK-PEDES, which is currently the only accessible dataset for text-base person retrieval task. DSSL achieves the state-of-the-art performance on CUHK-PEDES. To properly evaluate our proposed DSSL in the real scenarios, a Real Scenarios Text-based Person Reidentification (RSTPReid) dataset is constructed to benefit future research on text-based person retrieval, which will be publicly available.

研究の動機と目的

  • クロスモーダルな人物検索におけるノイズが多くずれが生じる特徴の課題に対処するため、人物情報と周囲の環境を明示的に分離する。
  • 特徴学習の過程で人物と周囲の特徴の相互排他的性をモデル化することで、検索精度を向上させる。
  • 特徴の識別性とクロスモーダルマッチングを強化するためのマルチスケール・マルチモーダルアライメントメカニズムを構築する。
  • リアルな監視状況をよりよく評価できるよう、現実的で大規模なベンチマークデータセット(RSTPReid)を構築する。

提案手法

  • 周囲と人物の分離および統合メカニズムにより、人物と周囲の特徴の相互排他的性を強制し、クリアで識別性の高い人物表現を確保する。
  • 5つの異なるアライメントパラダイム(AlignI–AlignIIIおよび2つの追加パラダイム)を用いて、相互排他的制約下での特徴学習をガイドする。
  • 信号ノイズ除去モジュール(SDM)は、入力ベクトル要素のランダムゼロ化を実行し、ランク付け損失を用いたオートエンコーダベースの再構成を適用することで、ノイズを除去しながらも重要な人物特徴を保持する。
  • 顕著な注意モジュール(SAM)は、抽出された人物情報を利用して、特徴の識別性の高いボディパーツに注目することで、局所的視覚特徴を強化する。
  • SDMにおける再構成にはランク付け損失が用いられ、これは検索性能においてユークリッド距離を上回ることが示された。
  • すべてのコンポonentを統合的に最適化することで、エンドツーエンドの学習が可能となり、効果的なクロスモーダルアライメントが実現される。

実験結果

リサーチクエスチョン

  • RQ1人物と周囲の特徴を明示的に分離することで、テキストベースの人物検索における検索精度が向上するか?
  • RQ2人物と周囲の特徴の相互排他的性を強制することで、特徴の質とモデルの一般化性能にどのような影響を与えるか?
  • RQ3不要な視覚的ノイズを除去しながらも、識別性のある人物の手がかりを保持する最適な信号ノイズ除去戦略は何か?
  • RQ4異なるアライメントパラダイムは、相互排他的な条件下での効果的なクロスモーダル特徴学習にどのように寄与するか?
  • RQ5既存のベンチマークと比較して、提案手法は実世界のシナリオにどの程度一般化可能か?

主な発見

  • DSSLは、CUHK-PEDESでトップ1、トップ5、トップ10の正確率がそれぞれ59.98%、80.41%、87.56%という最先端性能を達成した。
  • クロスモーダル再ランク戦略を適用することで、DSSLのトップ1正確率は62.33%に向上し、以前のSOTA手法を上回った。
  • 信号ノイズ除去モジュール(SDM)はゼロリングレートr=0.5で最適な性能を示し、r=0.9のような高いレートでは性能が低下した。
  • SDMでランク付け損失を使用した場合、ユークリッド距離を使用した場合に比べてトップ1正確率が1.05%向上し、検索タスクにおいて優位性が確認された。
  • 顕著な注意モジュール(SAM)を除去するとトップ1正確率が2.03%低下し、局所的特徴の識別性を強化する役割があることが確認された。
  • 新たに構築されたRSTPReidデータセットは、MSMT17に基づき、複雑な屋内および屋外のシーンにまたがる15台の異なるカメラから、1人あたり5枚の画像を含む。このデータセットにより、より現実的な評価が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。