Skip to main content
QUICK REVIEW

[论文解读] Focusing and Diffusion: Bidirectional Attentive Graph Convolutional Networks for Skeleton-based Action Recognition

Jialin Gao, Tong He|arXiv (Cornell University)|Dec 24, 2019
Human Pose and Action Recognition参考文献 39被引用 12
一句话总结

该论文提出双向注意力图卷积网络(BAGCN),通过聚焦与扩散机制,增强基于骨架的动作识别性能,以建模帧内语义依赖关系和帧间时序上下文。通过引入可学习的潜在Transformer节点,利用双向LSTM捕捉空间-时序上下文,并将其反向传播至关键点,BAGCN在NTU RGB+D和Skeleton-Kinetics基准上达到最先进性能,Cross-Subject协议下NTU-RGB+D准确率达到89.4%,Cross-View协议下达到96.3%。

ABSTRACT

A collection of approaches based on graph convolutional networks have proven success in skeleton-based action recognition by exploring neighborhood information and dense dependencies between intra-frame joints. However, these approaches usually ignore the spatial-temporal global context as well as the local relation between inter-frame and intra-frame. In this paper, we propose a focusing and diffusion mechanism to enhance graph convolutional networks by paying attention to the kinematic dependence of articulated human pose in a frame and their implicit dependencies over frames. In the focusing process, we introduce an attention module to learn a latent node over the intra-frame joints to convey spatial contextual information. In this way, the sparse connections between joints in a frame can be well captured, while the global context over the entire sequence is further captured by these hidden nodes with a bidirectional LSTM. In the diffusing process, the learned spatial-temporal contextual information is passed back to the spatial joints, leading to a bidirectional attentive graph convolutional network (BAGCN) that can facilitate skeleton-based action recognition. Extensive experiments on the challenging NTU RGB+D and Skeleton-Kinetics benchmarks demonstrate the efficacy of our approach.

研究动机与目标

  • 解决现有GCN在捕捉帧内非相邻关键点之间隐式语义关联以及帧间关键点之间关联方面的局限性。
  • 在超越固定或预定义图结构的基础上,建模人体骨架序列中的长程空间-时序依赖关系。
  • 通过上下文感知的双向注意力机制,学习动态、与动作相关的关节关系,以增强图卷积网络。
  • 通过两阶段聚焦与扩散过程,将全局空间-时序上下文整合到节点表征中,从而提升动作识别准确率。

提出的方法

  • 构建两个方向相反的图:聚焦图用于学习帧内有信息量的连接,扩散图用于将上下文信息反向传播至空间关键点。
  • 每帧引入一个可学习的潜在Transformer节点,以动态关注相关关键点并编码空间上下文,注意力权重通过可学习矩阵Wf计算。
  • 使用双向LSTM基于所学潜在节点序列建模帧间时序动态,捕捉长程时序依赖。
  • 应用两阶段消息传递机制:首先通过潜在节点聚焦于有信息量的关键点连接,然后将全局上下文扩散回空间节点以优化其嵌入表征。
  • 设计双向注意力GCN(BAGCN),将聚焦与扩散机制整合至标准GCN架构中,实现选择性注意力与上下文感知的特征学习。
  • 采用空间分支与运动分支的后期融合策略,进一步提升性能,其中空间分支提供主要识别信号。

实验结果

研究问题

  • RQ1可学习的潜在节点是否能有效建模单帧内超越物理连接或预定义图连接的隐式、动作特定关节依赖?
  • RQ2在潜在空间节点上引入双向LSTM时序建模,相比单向或无上下文建模,是否能显著提升识别性能?
  • RQ3聚焦与扩散机制在多大程度上通过将全局空间-时序上下文整合到局部节点嵌入中,提升了特征表征能力?
  • RQ4所提出的机制是否在基于骨架的动作识别中优于依赖固定或学习图拓扑的现有GCN方法?

主要发现

  • 在NTU-RGB+D数据集的Cross-Subject协议下,BAGCN达到89.4%的分类准确率,显著优于基线ST-GCN(84.8%)及消融模型。
  • 上下文感知模块结合双向LSTM对性能贡献最大,当完全使用时,准确率从无上下文的86.6%提升至89.4%。
  • 空间与运动分支的融合进一步将性能提升至Cross-Subject协议下的90.3%和Cross-View协议下的96.3%,表明运动与空间特征具有互补性。
  • 可视化结果表明,所学习的潜在节点会激活与动作相关的特定关键点(如“阅读”动作中激活手部与头部),证实模型学习到了有意义且与任务相关的依赖关系。
  • 消融实验表明,聚焦与扩散机制以及时序上下文感知模块均不可或缺,任一移除均导致性能下降超过2%。
  • 模型有效学习到关键点之间的稀疏、动态连接,注意力权重显示每种动作仅激活相关关键点,从而减少了无关关键点带来的噪声。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。