[论文解读] Combining the Silhouette and Skeleton Data for Gait Recognition
该论文提出了一种双分支深度学习框架,通过卷积神经网络(CNN)融合轮廓图(silhouettes)与图卷积网络(GCN)处理骨骼数据,实现鲁棒的步态识别。该方法引入一种全连接图卷积算子以捕捉长程关节依赖关系,并设计了STC-Att模块,实现空间、时间与通道维度的联合注意力机制,从而在各种条件下达到最先进性能,尤其在衣物变化条件下表现优异,在CASIA-B数据集上达到91.0%的平均准确率,在OUMVLP数据集上达到90.7%。
Gait recognition, a long-distance biometric technology, has aroused intense interest recently. Currently, the two dominant gait recognition works are appearance-based and model-based, which extract features from silhouettes and skeletons, respectively. However, appearance-based methods are greatly affected by clothes-changing and carrying conditions, while model-based methods are limited by the accuracy of pose estimation. To tackle this challenge, a simple yet effective two-branch network is proposed in this paper, which contains a CNN-based branch taking silhouettes as input and a GCN-based branch taking skeletons as input. In addition, for better gait representation in the GCN-based branch, we present a fully connected graph convolution operator to integrate multi-scale graph convolutions and alleviate the dependence on natural joint connections. Also, we deploy a multi-dimension attention module named STC-Att to learn spatial, temporal and channel-wise attention simultaneously. The experimental results on CASIA-B and OUMVLP show that our method achieves state-of-the-art performance in various conditions.
研究动机与目标
- 为解决基于外观的步态识别方法对衣物与携带物变化敏感的问题。
- 克服因姿态估计误差与稀疏骨骼数据导致的基于模型方法的性能瓶颈。
- 结合外观特征与基于模型特征的互补优势,提升识别鲁棒性。
- 设计一种基于GCN的模块,有效捕捉多尺度与长程关节依赖关系,且不依赖预设的骨骼连接关系。
- 通过多维注意力机制增强特征表示,同时建模空间、时间与通道维度的相关性。
提出的方法
- 采用双分支神经网络架构:一个分支使用CNN(以GaitPart作为主干网络)处理轮廓图,另一个分支使用基于GCN的模型处理骨骼序列。
- 提出一种全连接图卷积算子,替代多个邻接矩阵,实现无需依赖自然关节连接关系的多尺度关节依赖关系自适应融合。
- STC-Att模块在一个模块内联合学习空间、时间与通道维度的注意力机制,增强GCN分支中的判别性特征学习。
- 在通过可学习权重比λ进行平衡后,将双分支的特征进行拼接,融合外观与结构表征。
- 对融合后的特征应用全局平均池化与Softmax分类器,完成最终分类。
- 在CASIA-B与OUMVLP数据集上使用标准交叉熵损失函数进行端到端训练。
实验结果
研究问题
- RQ1在多样化条件下,融合轮廓图与骨骼数据的双分支网络是否能超越现有最先进步态识别方法?
- RQ2与使用固定邻接矩阵的传统GCN相比,全连接图卷积算子在建模长程关节依赖关系方面是否更有效?
- RQ3STC-Att模块在联合建模空间、时间与通道注意力方面,对步态表征的提升程度如何?
- RQ4融合外观特征与基于模型的特征是否能显著增强对衣物与视角变化的鲁棒性?
- RQ5何种最优融合比例λ能平衡双分支特征贡献,从而在不同条件下实现最高识别准确率?
主要发现
- 所提方法在CASIA-B数据集上达到91.0%的平均准确率,在OUMVLP数据集上达到90.7%,优于所有先前最先进方法。
- 在CASIA-B的CL(衣物变化)条件下,方法准确率达到92.1%,较GaitGL提升9.1%,展现出对衣物变化的强鲁棒性。
- 消融实验表明,全连接图卷积算子在NM条件下的平均准确率提升1.5%(从89.8%提升至91.3%),验证了其有效性。
- STC-Att模块进一步将性能平均提升0.5%(从91.3%提升至91.8%),证明其在特征精炼中的价值。
- 最优融合比例λ = 400在所有条件下均实现最高平均准确率(94.74%),证实了平衡特征融合的优势。
- 双分支网络在λ = 400时,NM条件达97.7%,BG条件达93.8%,CL条件达92.7%,显著优于单一分支(如仅基于模型的方法准确率为91.8%)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。