[论文解读] From Saliency to DINO: Saliency-guided Vision Transformer for Few-shot Keypoint Detection
该论文提出 SalViT,一种基于显著性引导的视觉Transformer模型,通过使用掩码自注意力机制和形态学学习器,聚焦前景区域并动态调整感受野,从而提升少样本关键点检测性能。该方法在严重遮挡情况下将PCK指标提升最高达10%,并通过利用DINO作为轻量级显著性检测器,优于标准模型。
Unlike current deep keypoint detectors that are trained to recognize limited number of body parts, few-shot keypoint detection (FSKD) attempts to localize any keypoints, including novel or base keypoints, depending on the reference samples. FSKD requires the semantically meaningful relations for keypoint similarity learning to overcome the ubiquitous noise and ambiguous local patterns. One rescue comes with vision transformer (ViT) as it captures long-range relations well. However, ViT may model irrelevant features outside of the region of interest due to the global attention matrix, thus degrading similarity learning between support and query features. In this paper, we present a novel saliency-guided vision transformer, dubbed SalViT, for few-shot keypoint detection. Our SalViT enjoys a uniquely designed masked self-attention and a morphology learner, where the former introduces saliency map as a soft mask to constrain the self-attention on foregrounds, while the latter leverages the so-called power normalization to adjust morphology of saliency map, realizing ``dynamically changing receptive field''. Moreover, as salinecy detectors add computations, we show that attentive masks of DINO transformer can replace saliency. On top of SalViT, we also investigate i) transductive FSKD that enhances keypoint representations with unlabelled data and ii) FSKD under occlusions. We show that our model performs well on five public datasets and achieves ~10% PCK higher than the normally trained model under severe occlusions.
研究动机与目标
- 为解决少样本关键点检测(FSKD)中在领域分布偏移和监督信号有限情况下的噪声与模糊局部模式问题。
- 通过建模显著前景区域内的长距离关系,改进支持集与查询特征之间的相似性学习。
- 通过使用DINO提取的注意力特征替代外部显著性检测器,降低计算开销,同时保持性能,因这些注意力特征与显著性图具有强对齐性。
- 通过掩码与对齐(MAA)策略提升对关键点遮挡的鲁棒性,增强在部分监督设置下的泛化能力。
提出的方法
- 提出一种掩码自注意力(M-SA)模块,利用显著性图作为软掩码,仅在前景标记上计算自注意力。
- 提出一种形态学学习器(ML),对显著性图应用幂归一化,实现感受野的动态调整,以更好地捕捉关键点候选周围的上下文信息。
- 采用DINO的注意力图替代外部显著性检测器,降低推理成本,同时保持性能表现。
- 设计一种归纳式少样本关键点检测(FSKD)变体,利用未标注数据增强支持集关键点原型,提升低样本设置下的表征质量。
- 在训练过程中应用掩码与对齐(MAA)策略,包括RGB、显著性图和CNN特征的掩码,以及概率图对齐,以增强对遮挡的鲁棒性。
- 采用多种对齐策略——图像空间(SimMIM)、预测空间(非遮挡损失)和特征空间(ℓ1、ℓ2、MMD)——以提升在遮挡条件下的泛化能力。
实验结果
研究问题
- RQ1显著性引导的注意力机制是否能通过聚焦于相关前景区域并抑制背景噪声,提升少样本关键点检测性能?
- RQ2形态学学习器在实现动态感受野自适应以增强少样本关键点检测特征表征方面效果如何?
- RQ3DINO的注意力图能否作为外部显著性检测器的轻量级、高效替代方案,且不损失性能?
- RQ4所提出的掩码与对齐(MAA)策略在少样本设置下对关键点遮挡的鲁棒性提升程度如何?
- RQ5通过未标注数据进行原型优化的归纳式FSKD是否能提升关键点原型质量与低样本场景下的泛化能力?
主要发现
- 在100%遮挡条件下,SalViT模型在Animal Pose数据集上的PCK指标相比正常训练模型实现10%的相对提升(最高提升约10%)。
- 与归纳基线相比,所提出的M-SA与ML组件在1-shot归纳式FSKD中,使Animal Pose数据集的调和得分提升3.23个百分点。
- 使用DINO注意力图作为显著性代理可显著降低计算成本,同时保持性能,与使用外部显著性模型相比,准确率下降可忽略。
- MAA策略中的概率图对齐方法优于其他对齐方式,在100%遮挡条件下,相比仅掩码策略提升PCK达2%,相比标准模型提升10%。
- 消融实验证实,训练过程中对RGB、显著性图和CNN特征进行掩码可提升鲁棒性,其中完整MAA策略(掩码+概率图对齐)在严重遮挡下表现最佳。
- 通过未标注数据进行原型优化的归纳式FSKD在Animal Pose和AwA数据集上分别提升4.97%和4.91%,证明了在低样本场景下数据增强的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。