[论文解读] Self-Attention Network for Skeleton-based Human Action Recognition
本文提出三种自注意力网络变体(SAN-V1、SAN-V2、SAN-V3),用于基于骨骼的动作识别,利用自注意力机制捕捉3D骨骼序列中的长程时空依赖关系。通过将这些变体与时间片段网络(TSN)结合,该方法在Kinetics-skeleton数据集上实现了最先进性能,Top-1准确率和Top-5准确率分别较之前最先进方法提升4.4%和7.9%,并在NTU RGB+D数据集上展现出一致的性能提升。
Skeleton-based action recognition has recently attracted a lot of attention. Researchers are coming up with new approaches for extracting spatio-temporal relations and making considerable progress on large-scale skeleton-based datasets. Most of the architectures being proposed are based upon recurrent neural networks (RNNs), convolutional neural networks (CNNs) and graph-based CNNs. When it comes to skeleton-based action recognition, the importance of long term contextual information is central which is not captured by the current architectures. In order to come up with a better representation and capturing of long term spatio-temporal relationships, we propose three variants of Self-Attention Network (SAN), namely, SAN-V1, SAN-V2 and SAN-V3. Our SAN variants has the impressive capability of extracting high-level semantics by capturing long-range correlations. We have also integrated the Temporal Segment Network (TSN) with our SAN variants which resulted in improved overall performance. Different configurations of Self-Attention Network (SAN) variants and Temporal Segment Network (TSN) are explored with extensive experiments. Our chosen configuration outperforms state-of-the-art Top-1 and Top-5 by 4.4% and 7.9% respectively on Kinetics and shows consistently better performance than state-of-the-art methods on NTU RGB+D.
研究动机与目标
- 解决RNN、CNN和图卷积网络在捕捉骨骼序列中长程时空依赖关系方面的局限性。
- 通过在3D骨骼数据中建模长程相关性,利用自注意力机制改进表示学习。
- 通过新颖的自注意力与时间片段网络集成,提升大规模基于骨骼的动作识别基准性能。
- 通过可视化帧间注意力模式,实现模型行为的可解释性。
提出的方法
- 提出三种自注意力网络变体(SAN-V1、SAN-V2、SAN-V3),利用缩放点积注意力在3D骨骼序列中建模长程依赖关系。
- 应用多头自注意力计算所有帧之间的加权相关性,无论时间距离远近,均可实现局部与全局上下文建模。
- 集成时间片段网络(TSN)以从片段中提取短期特征,随后对多个片段的预测结果进行共识融合。
- 采用逐元素平均池化作为共识函数,以聚合各片段的预测结果,其性能优于最大池化。
- 使用3D卷积神经网络主干网络从骨骼序列中提取初始特征,再输入至SAN模块。
- 可视化最终自注意力层的注意力权重,以分析帧间相关性并解释模型行为。
实验结果
研究问题
- RQ1自注意力机制能否有效建模3D骨骼序列中用于动作识别的长程时空依赖关系?
- RQ2将自注意力与时间片段网络(TSN)结合,如何提升基于骨骼的动作识别性能?
- RQ3自注意力骨干网络的最优配置(如网络深度、注意力头数量、共识函数)为何?
- RQ4注意力模式是否在不同主体和动作间表现出一致且可解释的相关性,表明对变化的鲁棒性?
主要发现
- 所提出的TS-SAN-V2与TS-SAN-V3模型在Kinetics-skeleton数据集上达到最先进性能,相比之前最先进方法,Top-1准确率提升4.4%,Top-5准确率提升7.9%。
- 在NTU RGB+D数据集上,该方法持续优于现有最先进方法,展现出强大的泛化能力。
- 逐元素平均共识函数优于逐元素最大池化,因其更符合自注意力输出的可微加权平均特性。
- 最优性能在层数与注意力头数的平衡配置下实现;参数过少或过多均会导致性能下降。
- 注意力图可视化显示,模型学习到了有意义且与动作相关的长程相关性——例如在“穿夹克”动作中,帧31对帧0表现出强烈注意力,表明对主体和视角变化具有鲁棒性。
- 在不同主体执行相同动作时,模型能捕捉到一致的注意力模式,表明其学习到了潜在的、语义上有意义的运动结构。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。