[论文解读] See Finer, See More: Implicit Modality Alignment for Text-based Person Retrieval
本文提出了一种隐式视觉-文本(IVT)框架,用于基于文本的人体检索,该框架使用单一共享主干网络联合学习视觉与文本表征,实现无需显式部件级标注的隐式模态对齐。通过引入多级对齐(MLA)和双向掩码建模(BMM),IVT在CUHK-PEDES、RSTPReID和ICFG-PEDES数据集上实现了最先进性能,捕捉了细粒度且微妙的跨模态对齐,即使在无显式身体部位标注的情况下也优于先前方法。
Text-based person retrieval aims to find the query person based on a textual description. The key is to learn a common latent space mapping between visual-textual modalities. To achieve this goal, existing works employ segmentation to obtain explicitly cross-modal alignments or utilize attention to explore salient alignments. These methods have two shortcomings: 1) Labeling cross-modal alignments are time-consuming. 2) Attention methods can explore salient cross-modal alignments but may ignore some subtle and valuable pairs. To relieve these issues, we introduce an Implicit Visual-Textual (IVT) framework for text-based person retrieval. Different from previous models, IVT utilizes a single network to learn representation for both modalities, which contributes to the visual-textual interaction. To explore the fine-grained alignment, we further propose two implicit semantic alignment paradigms: multi-level alignment (MLA) and bidirectional mask modeling (BMM). The MLA module explores finer matching at sentence, phrase, and word levels, while the BMM module aims to mine extbf{more} semantic alignments between visual and textual modalities. Extensive experiments are carried out to evaluate the proposed IVT on public datasets, i.e., CUHK-PEDES, RSTPReID, and ICFG-PEDES. Even without explicit body part alignment, our approach still achieves state-of-the-art performance. Code is available at: https://github.com/TencentYoutuResearch/PersonRetrieval-IVT.
研究动机与目标
- 解决现有基于文本的人体检索方法依赖独立模型和显式部件级标注的局限性。
- 通过在不增加推理复杂度的前提下,促进视觉与文本模态之间更深层次的交互,提升跨模态对齐能力。
- 挖掘细粒度(如词级)和微妙(如发型、标志)语义对齐,这些对齐常被显著性方法所忽略。
- 开发一种统一、高效且有效的主干架构,适用于端到端的基于文本的人体检索。
提出的方法
- 提出一种隐式视觉-文本(IVT)框架,采用单一共享的基于Transformer的网络同时提取图像与文本模态的特征,通过共享参数实现模态间的内在交互。
- 引入多级对齐(MLA),在句子、短语和词级别执行跨模态匹配,以捕捉细粒度语义对齐,且无需显式监督。
- 采用双向掩码建模(BMM),通过随机掩码视觉与文本标记,迫使模型通过重建缺失的语义线索来学习鲁棒的跨模态表征。
- 在单一网络中使用共享模块与特定模块,以在对齐的特征共享与模态特异性学习之间实现平衡,从而增强表征能力。
- 利用该架构避免先前方法中使用的交叉注意力机制带来的二次方推理成本,保持高检索速度。
- 通过BMM实现自监督学习策略,增强对齐效果,且无需人工标注部件级对应关系。
实验结果
研究问题
- RQ1统一的主干网络能否在保持或提升性能的同时,有效替代基于文本的人体检索中独立的视觉与文本编码器?
- RQ2隐式、自监督机制如何在不依赖昂贵的人工标注身体部位的情况下,提升细粒度跨模态对齐?
- RQ3视觉与文本标记的双向掩码在多大程度上能增强对显著区域之外的微妙语义对齐的发现能力?
- RQ4即使缺乏显式部件级监督,模型是否仍能学习到准确且多样的属性级对齐(如服装、配饰)?
- RQ5所提出的框架是否能在保持高推理效率的同时,实现最先进性能,相较现有方法更具优势?
主要发现
- IVT框架在三个公开基准数据集——CUHK-PEDES、RSTPReID和ICFG-PEDES上实现了最先进性能,且未使用任何显式部件级标注。
- 模型成功捕捉了发型和服装标志等细微属性,这些常被基线方法忽略,证明其具备‘看得更远’的能力,超越显著区域。
- 可视化结果证实,模型实现了精确的词级对齐,能正确将‘shoes’和‘handbag’等描述定位到对应图像区域。
- IVT的检索时间显著快于通用图文检索模型(如ViLT:CUHK-PEDES上为42秒 vs. 103,320秒),使其更适合实际部署。
- 尽管参数量多于基于LSTM的模型,IVT仍保持了具有竞争力的推理速度,并在速度与精度上均优于NAFS等方法。
- 消融实验表明,MLA与BMM均对性能提升有贡献,其中BMM在发现非显著但有意义的对齐方面尤为有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。