Skip to main content
QUICK REVIEW

[論文レビュー] Image-Specific Information Suppression and Implicit Local Alignment for Text-based Person Search

Shuanglin Yan, Hao Tang|arXiv (Cornell University)|Aug 30, 2022
Video Surveillance and Tracking Methods被引用数 9
ひとこと要約

本稿では、テキストベースの人物検索のためのマルチレベルアライメントネットワークMANetを提案する。この手法は、関係誘導型ロケライゼーションとチャネルアテンションフィルタリングモジュールを用いて、画像固有のノイズ(背景や環境要因)を抑制し、明示的な局所部分の生成やクロスモーダル相互作用を伴わずに、モダリティ共有のセマンティックトピック中心を介して微細な画像-テキスト対応関係を暗黙的に学習する。この方法により、推論コストのわずかな増加で最先端の性能が達成される。

ABSTRACT

Text-based person search (TBPS) is a challenging task that aims to search pedestrian images with the same identity from an image gallery given a query text. In recent years, TBPS has made remarkable progress and state-of-the-art methods achieve superior performance by learning local fine-grained correspondence between images and texts. However, most existing methods rely on explicitly generated local parts to model fine-grained correspondence between modalities, which is unreliable due to the lack of contextual information or the potential introduction of noise. Moreover, existing methods seldom consider the information inequality problem between modalities caused by image-specific information. To address these limitations, we propose an efficient joint Multi-level Alignment Network (MANet) for TBPS, which can learn aligned image/text feature representations between modalities at multiple levels, and realize fast and effective person search. Specifically, we first design an image-specific information suppression module, which suppresses image background and environmental factors by relation-guided localization and channel attention filtration respectively. This module effectively alleviates the information inequality problem and realizes the alignment of information volume between images and texts. Secondly, we propose an implicit local alignment module to adaptively aggregate all pixel/word features of image/text to a set of modality-shared semantic topic centers and implicitly learn the local fine-grained correspondence between modalities without additional supervision and cross-modal interactions. And a global alignment is introduced as a supplement to the local perspective. The cooperation of global and local alignment modules enables better semantic alignment between modalities. Extensive experiments on multiple databases demonstrate the effectiveness and superiority of our MANet.

研究の動機と目的

  • 画像固有の背景や環境要因による情報の不平等を軽減することで、テキストベースの人物検索におけるモダリティギャップを解消すること。
  • 微細なアライメントにおいてノイズや文脈的混乱に左右されやすい、明示的に生成された局所部分に依存しないこと。
  • 追加の教師信号や直接的なクロスモーダル相互作用なしに、画像とテキストの間の局所的対応関係を暗黙的に学習すること。
  • グローバルおよびローカルアライメントを統合的に最適化することで、異なるモダリティ間の意味的アライメントを向上させること。
  • 高パフォーマンスを維持しつつ、計算コストを抑えた軽量で効率的なモデルを開発すること。

提案手法

  • 画像固有の情報抑制モジュールは、グローバルな文脈を用いて、関係誘導型ロケライゼーションにより歩行者の領域を強調することで、背景の干渉を低減する。
  • インスタンス正規化とチャネル別アテンションを用いたチャネルアテンションフィルタリングにより、照明や天候などの環境要因を抑制する。
  • 暗黙的な局所アライメント(ILA)モジュールは、画像およびテキスト特徴を、学習可能なモダリティ共有のセマンティックトピック中心に適応的に集約し、明示的な部分マッチングやクロスモーダル相互作用なしに、局所的対応関係を暗黙的に学習する。
  • 各セマンティックトピック中心は、関連する画像領域およびテキスト語に動的にアテンションを向けることで、明示的な部分マッチングなしに微細なアライメントを形成する。
  • グローバルアライメントモジュールを導入し、補完的で粗いグレインのクロスモーダル測定を提供する。
  • グローバルおよびローカルアライメントの監視を統合したジョイント損失関数を用いて、エンドツーエンドで全ネットワークを訓練する。

実験結果

リサーチクエスチョン

  • RQ1背景や環境要因といった画像固有の情報は、どのようにして効果的に抑制可能か? これにより、テキストベースの人物検索における情報の不平等がどのように軽減されるか?
  • RQ2明示的に生成された局所部分や直接的なクロスモーダル相互作用に依存せずに、微細な画像-テキスト対応関係を暗黙的に学習することは可能か?
  • RQ3暗黙的な局所アライメントとグローバルアライメントを組み合わせた場合、リtrieval性能にどのような影響を与えるか?
  • RQ4従来の最先端手法と比較して、提案手法はTBPSにおいて効率性と正確性の両面でどのように差をつけるか?
  • RQ5モダリティ共有のセマンティックトピック中心は、多様な歩行者記述において、どれほど頑健で適応的な特徴アライメントを可能にするか?

主な発見

  • MANetはCUHK-PEDESデータセットで63.92%のランク-1精度を達成し、ベースラインより6.12ポイント高い性能を示した。
  • 画像固有の情報抑制モジュールは、背景や環境ノイズを低減することで性能を著しく向上させたことが、歩行者領域を強調する応答マップの可視化から裏付けられた。
  • 暗黙的な局所アライメントモジュールは、微細な対応関係を効果的に学習しており、各セマンティックトピック中心が意味的に関連する画像領域およびテキスト語にアテンションを向けることが確認された。
  • 推論時間の増加はわずか(ベースラインの13.722s対15.422s)であり、追加のモジュールを備えながらも高い効率性を示した。
  • アブレーションスタディの結果、抑制モジュールおよび暗黙的アライメントモジュールの両方が必須であり、性能向上に顕著な寄与を示した。
  • 定性的な結果では、MANetはベースラインよりもより正確な結果を検索しており、しばしばベースラインが失敗する状況でもトップ3内に正しい人物を特定できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。