[论文解读] GCN-DevLSTM: Path Development for Skeleton-Based Action Recognition
该论文提出GCN-DevLSTM,一种用于基于骨架的动作识别的新型混合模型,通过将基于路径发展的LSTM模块(G-DevLSTM)集成到图卷积网络中,以更好地捕捉时序动态。通过利用基于李群的路径发展实现降维,并增强对不规则采样的鲁棒性,该模型在NTU60、NTU120和Chalearn2013数据集上达到最先进准确率,在Chalearn2013上相比现有方法最高提升1.43%。
Skeleton-based action recognition (SAR) in videos is an important but challenging task in computer vision. The recent state-of-the-art (SOTA) models for SAR are primarily based on graph convolutional neural networks (GCNs), which are powerful in extracting the spatial information of skeleton data. However, it is yet clear that such GCN-based models can effectively capture the temporal dynamics of human action sequences. To this end, we propose the G-Dev layer, which exploits the path development -- a principled and parsimonious representation for sequential data by leveraging the Lie group structure. By integrating the G-Dev layer, the hybrid G-DevLSTM module enhances the traditional LSTM to reduce the time dimension while retaining high-frequency information. It can be conveniently applied to any temporal graph data, complementing existing advanced GCN-based models. Our empirical studies on the NTU60, NTU120 and Chalearn2013 datasets demonstrate that our proposed GCN-DevLSTM network consistently improves the strong GCN baseline models and achieves SOTA results with superior robustness in SAR tasks. The code is available at https://github.com/DeepIntoStreams/GCN-DevLSTM.
研究动机与目标
- 解决现有基于GCN的模型在有效捕捉骨架序列中复杂时序动态方面的局限性。
- 在骨架动作识别中超越标准的$K\times1$卷积操作,改进时序建模能力。
- 将粗糙路径理论中的路径发展整合到可学习、高效且鲁棒的时序模块中,用于序列图数据。
- 展示所提出的G-DevLSTM模块在多种GCN主干网络中的即插即用兼容性及其性能提升效果。
- 验证模型在真实场景中对帧丢失和不规则采样情况下的鲁棒性。
提出的方法
- 提出一种新颖的G-DevLSTM模块,将原本用于向量值时间序列的路径发展方法拓展至具有时变节点特征的图结构数据。
- 采用李群结构将序列节点特征表示为路径,实现原理清晰、低维且可微分的时序特征提取。
- 将路径发展层与LSTM结合,增强梯度流动,更有效地捕捉长程时序依赖关系,优于标准卷积或基于签名的方法。
- 使用拓扑非共享图结构(如CTRGCN),其中每个通道拥有独立的可学习邻接矩阵,既保留空间结构,又支持灵活的时序建模。
- 将G-DevLSTM模块作为即插即用的时序模块块,替换现有GCN框架中的标准时序卷积,无需对网络架构进行大规模修改。
- 采用多流架构,使关节特征独立通过G-DevLSTM模块处理后再进行融合,提升判别能力。
实验结果
研究问题
- RQ1粗糙路径理论中的路径发展能否被有效适配以建模图结构骨架序列中的时序动态?
- RQ2所提出的G-DevLSTM模块是否在捕捉动作识别的时序依赖关系方面优于标准$K\times1$卷积和基于签名的方法?
- RQ3G-DevLSTM模块在真实骨架数据中面对帧缺失和可变帧率时的鲁棒性如何?
- RQ4G-DevLSTM模块能否无缝集成到多种GCN主干网络中并持续提升性能?
- RQ5G-DevLSTM模块中各组件对整体模型准确率的相对贡献如何?
主要发现
- 在NTU60数据集上,GCN-DevLSTM在X-sub上达到90.8%的准确率,在X-view上达到95.7%,分别优于之前最先进方法CTRGCN 0.5%和0.8%。
- 在更大的NTU120数据集上,模型在X-sub上达到88.7%的准确率,在X-view上达到93.1%,展现出出色的可扩展性和性能表现。
- 在Chalearn2013手势数据集上,GCN-DevLSTM达到95.61%的准确率,超越之前最佳方法1.43%。
- 消融实验表明,移除路径发展层导致性能下降最大(在X-sub上从90.8%降至90.5%),证明其是准确率提升的主要贡献因素。
- 鲁棒性分析显示,GCN-DevLSTM在NTU60的所有帧丢失率下均保持优越准确率,始终优于CTRGCN和GCN-LSTM基线模型。
- 在NTU120和Chalearn2013上,该模型分别优于基于签名的方法Logsig-RNN和Cheng等人(2023)10.4%和2.75%,验证了路径发展相比路径签名的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。