[论文解读] HAP: Structure-Aware Masked Image Modeling for Human-Centric Perception
HAP 通过利用人体部位先验指导掩码采样,并通过结构不变对齐损失强制结构一致性,提出了一种面向以人为中心感知的结构感知掩码图像建模框架。使用普通的视觉Transformer,HAP在11项以人为中心的基准上实现了最先进性能,包括在MSMT17上进行行人重识别的78.1% mAP,以及在PA-100K上进行行人属性识别的86.54% mA。
Model pre-training is essential in human-centric perception. In this paper, we first introduce masked image modeling (MIM) as a pre-training approach for this task. Upon revisiting the MIM training strategy, we reveal that human structure priors offer significant potential. Motivated by this insight, we further incorporate an intuitive human structure prior - human parts - into pre-training. Specifically, we employ this prior to guide the mask sampling process. Image patches, corresponding to human part regions, have high priority to be masked out. This encourages the model to concentrate more on body structure information during pre-training, yielding substantial benefits across a range of human-centric perception tasks. To further capture human characteristics, we propose a structure-invariant alignment loss that enforces different masked views, guided by the human part prior, to be closely aligned for the same image. We term the entire method as HAP. HAP simply uses a plain ViT as the encoder yet establishes new state-of-the-art performance on 11 human-centric benchmarks, and on-par result on one dataset. For example, HAP achieves 78.1% mAP on MSMT17 for person re-identification, 86.54% mA on PA-100K for pedestrian attribute recognition, 78.2% AP on MS COCO for 2D pose estimation, and 56.0 PA-MPJPE on 3DPW for 3D pose and shape estimation.
研究动机与目标
- 探究掩码图像建模(MIM)作为以人为中心感知任务预训练范式的效果。
- 识别标准MIM在以人为中心设置下的局限性,并理解人体结构先验在提升性能中的作用。
- 开发一种简单而有效的方法,将人体部位先验整合到掩码采样过程中,以增强预训练期间的结构理解。
- 设计一种结构不变对齐损失,通过对齐同一图像的不同掩码视图来提升特征的可分性。
- 建立一个通用、可扩展且高效的预训练框架,用于多样化以人为中心的视觉任务,仅使用单一统一数据集和普通ViT架构。
提出的方法
- 引入一种人体部位先验——通过现成的关键点检测器提取——以指导掩码采样过程,优先对人身体部位区域内的图像块进行掩码。
- 采用标准的掩码图像建模目标,即模型利用可见上下文重建被掩码的图像块,且重建聚焦于语义上有意义的人体身体部位。
- 提出一种结构不变对齐损失,通过强制同一图像的两个随机掩码视图之间的一致性(均受人体部位先验引导)来保持结构不变性。
- 使用普通的视觉Transformer(ViT)作为编码器,实现无需复杂架构即可轻松迁移到下游任务。
- 在单一预训练数据集(LUPerson)中统一图像和关键点模态,实现在推理阶段无需多模态数据即可实现联合学习。
- 采用两阶段训练策略:在LUPerson上使用MIM和人体部位引导的掩码进行预训练,随后在下游任务上使用标准监督学习进行微调。
实验结果
研究问题
- RQ1掩码图像建模(MIM)能否被有效适配于以人为中心的感知任务?若可以,需要哪些修改以克服其初始性能不佳的问题?
- RQ2人体结构先验——特别是人体部位区域——如何提升MIM在以人为中心预训练中的有效性?
- RQ3掩码采样策略、缩放比例和中间掩码比例对MIM在以人为中心设置下的性能有何影响?
- RQ4结构不变对齐损失能否通过强制同一图像的不同掩码视图之间的一致性来提升特征可分性?
- RQ5基于简单ViT架构并结合人体部位引导的方法,在多样化以人为中心的基准上能达到多大程度的最先进性能?
主要发现
- 在MSMT17上进行行人重识别时,HAP实现了78.1%的mAP,创下该基准的新SOTA记录。
- 在PA-100K上进行行人属性识别时,HAP实现了86.54%的平均准确率,优于以往方法。
- 在MS COCO上的2D人体姿态估计任务中,HAP达到78.2%的AP,展现出在基于关键点任务上的强大泛化能力。
- 在3DPW上的3D姿态与形状估计任务中,HAP实现了56.0的PA-MPJPE,表明其在3D人体建模方面表现优异。
- 在CUHK-PEDES上,HAP在文本到图像行人重识别任务中达到68.05%的Rank-1准确率,表现具有竞争力。
- 仅预训练100个周期即可获得令人满意的结果,表明HAP具有高效性且训练成本低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。