Skip to main content
QUICK REVIEW

[论文解读] PSUMNet: Unified Modality Part Streams are All You Need for Efficient Pose-based Action Recognition

Neel Trivedi, Ravi Kiran Sarvadevabhatla|arXiv (Cornell University)|Aug 11, 2022
Human Pose and Action Recognition被引用 4
一句话总结

PSUMNet 提出了一种统一的模态分支流架构,用于高效的姿态动作识别,通过基于部位的处理替代传统的独立模态流,捕捉局部动态(例如,'竖大拇指'动作中的手部动态,'踢腿'动作中的腿部动态)。该方法在 NTU RGB+D 60/120 和 NTU-X 数据集上实现了最先进(SOTA)的准确率,参数量比之前的方法减少了 100%-400%,从而实现了在边缘设备上的高效部署。

ABSTRACT

Pose-based action recognition is predominantly tackled by approaches which treat the input skeleton in a monolithic fashion, i.e. joints in the pose tree are processed as a whole. However, such approaches ignore the fact that action categories are often characterized by localized action dynamics involving only small subsets of part joint groups involving hands (e.g. `Thumbs up') or legs (e.g. `Kicking'). Although part-grouping based approaches exist, each part group is not considered within the global pose frame, causing such methods to fall short. Further, conventional approaches employ independent modality streams (e.g. joint, bone, joint velocity, bone velocity) and train their network multiple times on these streams, which massively increases the number of training parameters. To address these issues, we introduce PSUMNet, a novel approach for scalable and efficient pose-based action recognition. At the representation level, we propose a global frame based part stream approach as opposed to conventional modality based streams. Within each part stream, the associated data from multiple modalities is unified and consumed by the processing pipeline. Experimentally, PSUMNet achieves state of the art performance on the widely used NTURGB+D 60/120 dataset and dense joint skeleton dataset NTU 60-X/120-X. PSUMNet is highly efficient and outperforms competing methods which use 100%-400% more parameters. PSUMNet also generalizes to the SHREC hand gesture dataset with competitive performance. Overall, PSUMNet's scalability, performance and efficiency makes it an attractive choice for action recognition and for deployment on compute-restricted embedded and edge devices. Code and pretrained models can be accessed at https://github.com/skelemoa/psumnet

研究动机与目标

  • 为解决现有基于姿态的动作识别方法在处理骨骼时效率低下且采用整体性处理方式的问题,这些方法将骨骼视为整体实体。
  • 克服独立模态流的局限性,后者导致参数量增加并忽略模态间的相关性。
  • 通过引入基于部位的流处理,提升对特定关节组主导的动作(例如,手部或腿部动作)的性能。
  • 实现对不同骨骼配置的可扩展性,包括密集骨骼(NTU-X)和稀疏骨骼(SHREC)数据集。
  • 设计一种轻量化、高效的架构,适用于计算资源受限的边缘和嵌入式设备的实际部署。

提出的方法

  • 提出一种统一的模态处理流程,将多种模态(关节、骨骼、关节速度、骨骼速度)在每个部位流内部进行融合,而非使用独立的流结构。
  • 引入基于部位的流(身体、手部、腿部),在全局参考框架下处理完整姿态的子骨骼,从而实现局部化且具备上下文感知的表征。
  • 在不同流之间使用重叠的关节组,以在保留全局运动传播的同时,实现对局部动作的专门化处理。
  • 每个部位流使用共享主干网络,并在输入层实现模态融合,相比独立流训练,显著降低了参数量。
  • 采用流预测的后期融合策略,结合各部位流的专用表征,而无需增加单一流结构的模型复杂度。
  • 设计架构时考虑跨不同数据集的可扩展性,包括全身体(NTURGB+D)、密集骨骼(NTU-X)和稀疏骨骼(SHREC)配置。

实验结果

研究问题

  • RQ1统一的模态处理策略是否能在保持或提升性能的同时显著减少参数量?
  • RQ2基于部位的流处理是否在捕捉局部动作动态方面优于整体性或分离的部位处理?
  • RQ3所提出的架构在具有不同关节密度和配置的多样化骨骼数据集上是否具备良好的泛化能力?
  • RQ4当模态在每个部位流内部联合处理时,模态间相关性对性能的贡献程度如何?
  • RQ5所提出的方法是否能在显著减少参数量的前提下,实现比现有多流方法更先进的准确率?

主要发现

  • PSUMNet 在 NTU60 的跨被试划分上达到 92.9% 的准确率,在 NTU120 上达到 89.4%,优于最先进方法,且参数量减少 100%-400%。
  • 仅使用身体流在 NTU60 上即达到 91.9% 的准确率,而身体+手部流组合达到 92.4%,证明了专用部位流的优势。
  • 腿部流在 NTU60 上达到 60.4% 的准确率,表明以腿部动作为主导的动作虽不频繁,但仍能被有效捕捉。
  • PSUMNet 在早期动作识别任务中优于 CTR-GCN,在仅观察序列的 30%-50% 时仍保持更高准确率。
  • 消融实验表明,关节和骨骼模态对性能贡献最大,使用全部四种模态可获得最佳结果。
  • 统一模态处理方法相比独立流训练显著减少了参数量,PSUMNet 尽管融合了四种模态,仅使用 2.8M 参数。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。