Skip to main content
QUICK REVIEW

[论文解读] Generative Action Description Prompts for Skeleton-based Action Recognition

Wangmeng Xiang, Chao Li|arXiv (Cornell University)|Aug 10, 2022
Human Pose and Action Recognition被引用 9
一句话总结

该论文提出了一种新型多模态训练框架——生成式动作描述提示(GAP),用于基于骨架的动作识别。该框架利用预训练语言模型(GPT-3)自动生成动作及身体部位运动的详细文本描述,并通过对比损失将这些描述与骨架特征对齐,从而在不增加推理计算成本的前提下提升表征学习能力,在NTU RGB+D、NTU RGB+D 120和NW-UCLA基准上实现了最先进性能。

ABSTRACT

Skeleton-based action recognition has recently received considerable attention. Current approaches to skeleton-based action recognition are typically formulated as one-hot classification tasks and do not fully exploit the semantic relations between actions. For example, "make victory sign" and "thumb up" are two actions of hand gestures, whose major difference lies in the movement of hands. This information is agnostic from the categorical one-hot encoding of action classes but could be unveiled from the action description. Therefore, utilizing action description in training could potentially benefit representation learning. In this work, we propose a Generative Action-description Prompts (GAP) approach for skeleton-based action recognition. More specifically, we employ a pre-trained large-scale language model as the knowledge engine to automatically generate text descriptions for body parts movements of actions, and propose a multi-modal training scheme by utilizing the text encoder to generate feature vectors for different body parts and supervise the skeleton encoder for action representation learning. Experiments show that our proposed GAP method achieves noticeable improvements over various baseline models without extra computation cost at inference. GAP achieves new state-of-the-arts on popular skeleton-based action recognition benchmarks, including NTU RGB+D, NTU RGB+D 120 and NW-UCLA. The source code is available at https://github.com/MartinXM/GAP.

研究动机与目标

  • 为解决单热分类在捕捉相似动作之间细微语义差异(如“比出胜利手势”与“竖大拇指”)方面的局限性。
  • 探究动作和身体部位的自然语言描述是否能够增强基于骨架的动作识别中的表征学习。
  • 开发一种低成本、可扩展的多模态训练范式,避免对昂贵的人工标注骨架-文本数据集的依赖。
  • 通过引入关于身体部位运动和动作语义的先验知识,实现更好的泛化能力和特征对齐。
  • 在不增加推理阶段计算成本的前提下,实现在标准基准上的最先进性能。

提出的方法

  • 利用GPT-3作为知识引擎,通过提示模板自动生成动作及个体身体部位的详细、结构化文本描述。
  • 设计双编码器框架,其中骨架编码器用于处理关节点坐标,文本编码器用于处理生成的描述。
  • 应用多部分对比损失,将身体部位的文本编码特征与对应骨架编码特征对齐。
  • 将全局动作嵌入的交叉熵损失与部件级别特征的对比损失相结合,以提升表征学习效果。
  • 在训练过程中同时使用分类监督和对比监督来训练骨架编码器,而文本编码器仅在训练阶段激活。
  • 通过离线方式利用GPT-3生成动作描述,避免在训练或推理阶段进行实时大语言模型推断。

实验结果

研究问题

  • RQ1能否通过自动生成的动作和身体部位自然语言描述来提升基于骨架的动作识别性能?
  • RQ2将动作描述中的语义知识引入后,对细粒度动作表征学习有何影响?
  • RQ3使用大语言模型生成提示的多模态训练方案是否能超越标准的单热分类基线?
  • RQ4所提出方法在不同动作类别中是否具有泛化能力,包括身体部位运动存在细微差异的动作?
  • RQ5该模型能否在不增加推理阶段计算成本的情况下实现最先进性能?

主要发现

  • GAP在NTU RGB+D、NTU RGB+D 120和NW-UCLA基准上实现了最先进性能,且未引入任何额外的推理计算开销。
  • 通过利用动作之间的语义差异(如通过手部动作描述区分“比出胜利手势”与“竖大拇指”),模型显著提升了表征学习能力。
  • 多部分对比损失的使用显著增强了骨架与文本对身体部位的表征对齐效果。
  • 实验表明,大语言模型生成的描述可有效作为零样本或少样本设置下的监督信号,即使在无人工标注文本数据的情况下亦成立。
  • 实验结果证实,该方法在多种基线模型(包括GCN、ST-GCN和Graphor)上均持续提升了准确率。
  • 消融实验表明,全局与部件级别的文本监督均对性能提升有贡献,其中部件级别的对比损失在细粒度动作区分方面尤为有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。