[论文解读] Temporal Graph Modeling for Skeleton-based Action Recognition
该论文提出时序增强图卷积网络(TE-GCN),通过构建时序关系图,显式捕捉相邻与非相邻时序依赖关系,利用可学习边连接实现。多头机制增强了对多样化时序关系的建模能力,在NTU-60和NTU-120 RGB+D数据集上分别取得90.8%和85.9%的准确率,对应CS和C-setup评估协议,达到当前最先进性能。
Graph Convolutional Networks (GCNs), which model skeleton data as graphs, have obtained remarkable performance for skeleton-based action recognition. Particularly, the temporal dynamic of skeleton sequence conveys significant information in the recognition task. For temporal dynamic modeling, GCN-based methods only stack multi-layer 1D local convolutions to extract temporal relations between adjacent time steps. With the repeat of a lot of local convolutions, the key temporal information with non-adjacent temporal distance may be ignored due to the information dilution. Therefore, these methods still remain unclear how to fully explore temporal dynamic of skeleton sequence. In this paper, we propose a Temporal Enhanced Graph Convolutional Network (TE-GCN) to tackle this limitation. The proposed TE-GCN constructs temporal relation graph to capture complex temporal dynamic. Specifically, the constructed temporal relation graph explicitly builds connections between semantically related temporal features to model temporal relations between both adjacent and non-adjacent time steps. Meanwhile, to further explore the sufficient temporal dynamic, multi-head mechanism is designed to investigate multi-kinds of temporal relations. Extensive experiments are performed on two widely used large-scale datasets, NTU-60 RGB+D and NTU-120 RGB+D. And experimental results show that the proposed model achieves the state-of-the-art performance by making contribution to temporal modeling for action recognition.
研究动机与目标
- 为解决现有基于GCN的方法因依赖堆叠的一维局部卷积而难以建模长程时序依赖的问题。
- 通过构建连接语义相关但非相邻时间步的时序关系图,显式建模骨架序列中的复杂时序动态。
- 通过引入多头注意力机制,捕捉多种高阶时序关系,以提升动作识别性能。
- 探索多模态表征(关节、骨骼、运动)在多流TE-GCN框架中的应用,以增强特征学习。
提出的方法
- 构建时序关系图,其中节点表示时序特征,边表示不同时间步特征之间的可学习相关性。
- 设计两种边构建函数——特征计算与特征学习,分别基于特征相似性或可学习参数来计算时序关系。
- 引入多头机制,学习多个注意力头,每个头捕捉非相邻时间步之间的不同类型时序依赖。
- 应用多头时序增强图卷积,聚合多样化时序关系,丰富特征表征。
- 通过分别处理关节、骨骼和运动模态后融合其表征,实现多流TE-GCN的集成,以提升性能。
- 使用标准GCN层进行空间建模,并将其与所提出的时序图卷积结合,实现端到端动作识别。
实验结果
研究问题
- RQ1可学习的时序关系图是否能有效建模骨架序列中超越相邻步卷积的非相邻时序依赖?
- RQ2多头注意力机制如何提升动作识别中对多样化时序关系的建模能力?
- RQ3在多流TE-GCN框架中,融合关节、骨骼和运动模态在多大程度上提升了识别性能?
- RQ4所提出的时序图构建方法是否在大规模数据集的不同评估协议下均带来一致的性能增益?
主要发现
- 所提出的TE-GCN在NTU-60 RGB+D数据集的跨主体(CS)协议下达到90.8%的识别准确率,较之前最先进方法提升0.8个百分点。
- 在NTU-120 RGB+D数据集上,模型在C-setup协议下达到85.9%的准确率,展现出优异的泛化能力与对现有基于GCN方法的优越性。
- 在CS协议下,融合关节与骨骼模态使性能从87.4%提升至88.9%;而结合所有四种模态(关节与骨骼的空间与运动表征)时,CS与CV协议下的准确率分别达到90.84%和96.2%。
- 多头机制显著提升了对复杂时序动态的建模能力,表现为在两个数据集及所有评估协议下均保持一致的性能增益。
- 消融实验证实,时序关系图与多头注意力机制为关键组件,移除后性能显著下降。
- 该方法在模态间具有良好的泛化能力,多流TE-GCN在融合关节、骨骼与运动表征时表现出互补性提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。