[論文レビュー] Towards Unified Text-based Person Retrieval: A Large-scale Multi-Attribute and Language Search Benchmark
本稿では、151万枚の画像・テキストペアと1枚あたり27の属性を備えた大規模な合成ベンチマーク「MALS」を紹介する。このデータは拡散モデルとキャプションパイプラインを用いて生成された。本稿では、属性認識とテキストベースの検索を同時に学習するためのAPT Mフレームワークを提案し、属性プロンプト学習と対照的学習を用いて共同事前学習を実現。CUHK-PEDES、ICFG-PEDES、RSTPReidの各ベンチマークで、それぞれ+6.96%、+7.68%、+16.95%のRecall@1のSOTA性能を達成した。
In this paper, we introduce a large Multi-Attribute and Language Search dataset for text-based person retrieval, called MALS, and explore the feasibility of performing pre-training on both attribute recognition and image-text matching tasks in one stone. In particular, MALS contains 1,510,330 image-text pairs, which is about 37.5 times larger than prevailing CUHK-PEDES, and all images are annotated with 27 attributes. Considering the privacy concerns and annotation costs, we leverage the off-the-shelf diffusion models to generate the dataset. To verify the feasibility of learning from the generated data, we develop a new joint Attribute Prompt Learning and Text Matching Learning (APTM) framework, considering the shared knowledge between attribute and text. As the name implies, APTM contains an attribute prompt learning stream and a text matching learning stream. (1) The attribute prompt learning leverages the attribute prompts for image-attribute alignment, which enhances the text matching learning. (2) The text matching learning facilitates the representation learning on fine-grained details, and in turn, boosts the attribute prompt learning. Extensive experiments validate the effectiveness of the pre-training on MALS, achieving state-of-the-art retrieval performance via APTM on three challenging real-world benchmarks. In particular, APTM achieves a consistent improvement of +6.96%, +7.68%, and +16.95% Recall@1 accuracy on CUHK-PEDES, ICFG-PEDES, and RSTPReid datasets by a clear margin, respectively.
研究の動機と目的
- テキストベースの人物検索におけるデータ不足とアノテーション品質の問題を解決するため、大規模で高品質な合成データセットを生成すること。
- 共有表現を用いて、テキストベースの検索と歩行者属性認識の両タスクを統合的に事前学習可能にする。
- スケーラブルでプライバシーを保護するベンチマークを構築し、詳細な視覚的および言語的アノテーションを備えて実世界の展開を可能にすること。
- 属性プロンプト学習とテキストマッチングの共同学習が、検索性能の向上に寄与するかを検証すること。
提案手法
- 事前学習済みの拡散モデルを活用し、ポーズ、外見、背景の変化を制御した高精細で多様な歩行者画像を生成する。
- 実世界のテキストベースの検索記述文をプロンプトとして用い、画像生成を誘導することで、実際のクエリと整合性のある意味的整合性を確保する。
- 自動属性抽出パイプラインを適用し、生成されたキャプションから27の属性を抽出することで、アノテーションの多様性を高める。
- 2つの並列ストリーム(属性プロンプト学習とテキストマッチング学習)を持つAPT Mフレームワークを提案。対照的学習とマスクモデル化を用いて共同最適化を実現。
- テキストを属性プロンプトにマッピングし、整合性を向上させるために、明示的マッチング(EM)と暗黙的拡張(IE)のメカニズムを統合。
- 画像・テキスト対照的学習(ITC)、画像・属性対照的学習(IAC)、マスクモデル化(MLM/MAM)を用いて表現学習を正則化する。
実験結果
リサーチクエスチョン
- RQ1拡散モデルを用いて生成された合成データは、テキストベースの人物検索のための効果的な事前学習を支えるのに十分な現実性と整合性を備えているか?
- RQ2属性認識とテキストベースの検索を共同で事前学習することで、下流ベンチマークにおける汎化性能と性能が向上するか?
- RQ3合成データの規模が、ゼロショットおよび微調整設定における検索性能に与える影響は何か?
- RQ4属性プロンプト学習と標準的なテキストマッチングの両者の中で、どちらが検索精度の向上により寄与しているか?
主な発見
- MALSで事前学習することで、CUHK-PEDESで+6.96%、ICFG-PEDESで+7.68%、RSTPReidで+16.95%のRecall@1向上を達成。汎化性能の高さが裏付けられた。
- APT Mフレームワークは、RethinkPARベンチマークにおいてベースライン比0.97%の平均正答率(mA)の向上を達成した。
- 事前学習データ量の増加に伴い性能が向上するが、0.3Mサンプルを超えると増益が鈍り、飽和する傾向を示した。
- アブレーションスタディの結果、提案された属性プロンプト学習(APL)損失が、単純な分類ベースラインを明確に上回ることを確認した。
- テキストマッチングと属性プロンプトの共同最適化により、それぞれのタスクを別個に学習した場合よりも優れた特徴表現が得られた。
- 歩行者属性認識タスクにおいても競争力のある性能を達成し、統合学習の有効性が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。