[论文解读] Seeing the Pose in the Pixels: Learning Pose-Aware Representations in Vision Transformers
本论文提出两种新方法——姿态感知注意力模块(PAAB)与姿态感知辅助任务(PAAT),以在视觉变换器(Vision Transformers)中学习姿态感知表征,用于视频理解。通过将2D姿态关键点信息融入ViT架构,两种方法均提升了动作识别与多视角视频对齐的性能,其中PAAT在七个数据集上达到最先进水平,相较于基线模型,在机器人视频对齐任务中提升最高达21.8%,在真实世界动作识别任务中提升最高达9.8%。
Human perception of surroundings is often guided by the various poses present within the environment. Many computer vision tasks, such as human action recognition and robot imitation learning, rely on pose-based entities like human skeletons or robotic arms. However, conventional Vision Transformer (ViT) models uniformly process all patches, neglecting valuable pose priors in input videos. We argue that incorporating poses into RGB data is advantageous for learning fine-grained and viewpoint-agnostic representations. Consequently, we introduce two strategies for learning pose-aware representations in ViTs. The first method, called Pose-aware Attention Block (PAAB), is a plug-and-play ViT block that performs localized attention on pose regions within videos. The second method, dubbed Pose-Aware Auxiliary Task (PAAT), presents an auxiliary pose prediction task optimized jointly with the primary ViT task. Although their functionalities differ, both methods succeed in learning pose-aware representations, enhancing performance in multiple diverse downstream tasks. Our experiments, conducted across seven datasets, reveal the efficacy of both pose-aware methods on three video analysis tasks, with PAAT holding a slight edge over PAAB. Both PAAT and PAAB surpass their respective backbone Transformers by up to 9.8% in real-world action recognition and 21.8% in multi-view robotic video alignment. Code is available at https://github.com/dominickrei/PoseAwareVT.
研究动机与目标
- 通过引入姿态先验,解决传统视觉变换器在处理日常视频中细微、视角多变动作时的局限性。
- 克服标准ViT中对所有图像块统一处理的缺陷,从而忽略基于姿态的实体(如人体骨骼或机械臂)的问题。
- 开发高效、即插即用的方法,将2D姿态关键点信息融入ViT,无需深度传感器或复杂的3D姿态估计。
- 通过在训练过程中利用姿态信息,实现视角无关的细粒度视频表征学习。
- 在多种下游任务中实现良好泛化,包括动作识别、视频检索与多视角机器人视频对齐。
提出的方法
- 提出姿态感知注意力模块(PAAB),一种即插即用的ViT模块,通过2D关键点热图识别出与姿态相关的图像块,并在这些区域应用局部自注意力机制。
- 设计姿态感知辅助任务(PAAT),一种多任务学习策略:在训练过程中,通过独立头预测2D关键点位置,与主任务(如视频分类或对齐)联合优化。
- 利用现成的2D姿态估计模型(如MediaPipe)提取准确且低成本的关键点监督信号,供PAAB与PAAT使用。
- 保持原始ViT架构与训练流程不变,仅作微小修改:添加姿态感知注意力机制(PAAB)或辅助损失(PAAT)。
- 确保姿态监督作用于图像块级别,使模型能够学习姿态与非姿态特征之间的解耦表征。
- 通过前馈网络学习姿态感知表征,消融实验表明其注意力分布与基线模型相比变化极小。
实验结果
研究问题
- RQ1将2D姿态关键点信息融入视觉变换器是否能提升在涉及细微或视角多变动作的视频理解任务中的性能?
- RQ2在ViT中使用姿态先验是否能带来比标准ViT更解耦且视角无关的特征表征?
- RQ3注意力机制或前馈网络在ViT中学习姿态感知表征时的贡献程度如何?
- RQ4姿态感知ViT在动作识别与多视角视频对齐等多样化数据集与下游任务中的性能泛化能力如何?
- RQ5辅助姿态预测任务(PAAT)是否比架构修改方法(PAAB)更有效地学习姿态感知特征?
主要发现
- PAAT在七个数据集上均达到最先进性能,相较于基线ViT,在多视角机器人视频对齐任务中最高提升21.8%,在真实世界动作识别任务中最高提升9.8%。
- PAAB与PAAT均显著提升了特征空间中姿态与非姿态标记之间的可分性,其中PAAT因关键点特定的预测目标,展现出更优的解耦能力。
- 与基线TimeSformer相比,PAAB与PAAT的注意力分布基本保持不变,表明姿态感知表征主要通过前馈网络学习,而非注意力机制。
- PAAT在浅层网络中表现更优,表明姿态先验在初始特征抽象阶段最具价值。
- PAAT无需额外参数或推理计算开销,仅在主ViT基础上增加辅助损失,因此比PAAB(需添加专用注意力模块)更具效率。
- 所提方法在各类任务与数据集上均表现出良好泛化能力,包括视频检索的跨数据集评估,证实其鲁棒性与可迁移性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。