[论文解读] Two-person Graph Convolutional Network for Skeleton-based Human Interaction Recognition
本文提出了一种双人图卷积网络(2P-GCN),通过将两个人的骨骼统一为单一联合图结构,建模人体内部及人与人之间的关系,从而捕捉跨体和体内关系。通过引入新颖的边标签策略和双人图卷积模块,2P-GCN在四个基准数据集上实现了最先进性能,在NTU-120-Interaction上的准确率最高提升3.08%,同时仅使用1.47M参数和3.74G FLOPs。
Graph convolutional networks (GCNs) have been the predominant methods in skeleton-based human action recognition, including human-human interaction recognition. However, when dealing with interaction sequences, current GCN-based methods simply split the two-person skeleton into two discrete graphs and perform graph convolution separately as done for single-person action classification. Such operations ignore rich interactive information and hinder effective spatial inter-body relationship modeling. To overcome the above shortcoming, we introduce a novel unified two-person graph to represent inter-body and intra-body correlations between joints. Experiments show accuracy improvements in recognizing both interactions and individual actions when utilizing the proposed two-person graph topology. In addition, We design several graph labeling strategies to supervise the model to learn discriminant spatial-temporal interactive features. Finally, we propose a two-person graph convolutional network (2P-GCN). Our model achieves state-of-the-art results on four benchmarks of three interaction datasets: SBU, interaction subsets of NTU-RGB+D and NTU-RGB+D 120.
研究动机与目标
- 为解决现有基于GCN的方法将双人交互视为孤立的单人图结构,从而丢失关键交互信息的局限性。
- 设计一种统一的双人图拓扑结构,同时编码体内关节连接与两人之间的关系。
- 开发图标签策略,引导模型学习具有判别性的时空交互特征。
- 提出一种双人图卷积模块(2P-GCB),实现在单次图卷积操作中有效提取特征。
- 在基于骨骼的人体交互识别的多个基准数据集上实现最先进性能。
提出的方法
- 本文提出一种双人图结构,将每帧的交互表示为一个包含2N个关节(每人N个)的单一图,实现对体内与体间连接的联合建模。
- 构建关系邻接矩阵,编码物理骨骼连接(体内)和人与人之间的连接(体间),边权重反映关联强度。
- 设计图边标签策略,监督模型学习有意义的时空交互特征,增强表征的判别能力。
- 开发双人图卷积模块(2P-GCB),在统一的双人图上执行图卷积,保留各层间的交互感知特征。
- 在多种GCN架构上评估2P-GCN模型,结果表明在不同主干网络上均实现一致的准确率提升。
- 该方法具备可扩展性和泛化能力,可进一步推广至多人及人机交互场景。
实验结果
研究问题
- RQ1统一的双人图表示能否提升基于骨骼的人体交互识别中体间与体内关系的建模能力?
- RQ2图标签策略如何影响模型学习交互识别判别性时空特征的能力?
- RQ3将孤立的单人图替换为联合双人图是否能在不同GCN架构上带来一致的性能提升?
- RQ4所提出的2P-GCN在标准交互识别基准上的性能相比最先进方法提升程度如何?
- RQ5双人图表示是否也能提升单人动作识别任务的性能?
主要发现
- 2P-GCN在四个基准数据集上均达到最先进准确率,其中在X-Sub上达到97.05%,在NTU-Interaction的X-View上达到98.80%,分别优于2S-AIGCN 1.71%和0.80%。
- 在NTU120-Interaction上,2P-GCN在X-Sub120和X-Set120上的准确率分别达到93.47%和93.73%,较2S-AIGCN分别提升2.76%和3.08%。
- 在SBU数据集上,2P-GCN达到98.90%的准确率,优于此前最先进方法AIGCN的0.20%和DR-GCN的0.14%。
- 尽管建模了更丰富的交互特征,2P-GCN仍保持极低复杂度,仅使用1.47M参数和3.74G FLOPs,显著低于许多最先进模型。
- 双人图表示不仅提升了交互识别任务的性能,也显著改善了单人动作识别任务的性能,展现出更广泛的应用潜力。
- 消融实验验证,所提出的双人图拓扑结构在所有测试的GCN模型上均一致提升准确率,证实其有效性与泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。