[论文解读] Learning Rich Features for Gait Recognition by Integrating Skeletons and Silhouettes
该论文提出了一种新颖的双模态融合(BiFusion)网络,通过多尺度步态图(MSGG)网络利用身体关节的分层语义,将轮廓图与骨骼数据相结合,实现步态识别。该方法在CASIA-B数据集上于极具挑战性的跨服装条件下实现了92.1%的rank-1准确率,达到当前最优性能,证明了判别性骨骼特征学习与特征级融合的有效性。
Gait recognition captures gait patterns from the walking sequence of an individual for identification. Most existing gait recognition methods learn features from silhouettes or skeletons for the robustness to clothing, carrying, and other exterior factors. The combination of the two data modalities, however, is not fully exploited. Previous multimodal gait recognition methods mainly employ the skeleton to assist the local feature extraction where the intrinsic discrimination of the skeleton data is ignored. This paper proposes a simple yet effective Bimodal Fusion (BiFusion) network which mines discriminative gait patterns in skeletons and integrates with silhouette representations to learn rich features for identification. Particularly, the inherent hierarchical semantics of body joints in a skeleton is leveraged to design a novel Multi-Scale Gait Graph (MSGG) network for the feature extraction of skeletons. Extensive experiments on CASIA-B and OUMVLP demonstrate both the superiority of the proposed MSGG network in modeling skeletons and the effectiveness of the bimodal fusion for gait recognition. Under the most challenging condition of walking in different clothes on CASIA-B, our method achieves the rank-1 accuracy of 92.1%.
研究动机与目标
- 为解决现有步态识别方法对骨骼数据内在判别能力利用不足的问题。
- 通过有效融合两种模态,克服轮廓图(身体部位细节丢失)与骨骼图(形状信息丢失)的互补性缺陷。
- 设计一种分层的多尺度图神经网络,从原始骨骼序列中捕捉步态模式,提升表征学习能力。
- 在服装和视角变化等具有挑战性的条件下实现鲁棒的步态识别,其中外观变化显著影响性能。
提出的方法
- 多尺度步态图(MSGG)网络通过将身体关节划分为三个语义层级(单个关节、肢体、身体部位)来分层建模骨骼数据。
- 引入一种任务特定的节点划分策略,基于解剖学与运动语义将关节分组为有意义的子图,增强结构表征能力。
- MSGG采用金字塔结构,包含三条并行分支,分别处理不同尺度的子图,实现在空间与时间维度上的多层次特征学习。
- 通过语义池化操作实现跨尺度信息传递,聚合并优化多尺度特征,提升模型鲁棒性与判别能力。
- 设计一个特征级融合模块,将来自轮廓图(通过GaitPart提取)与骨骼图(通过MSGG提取)的判别性特征进行融合,形成全面的步态表征。
- 整个BiFusion网络采用端到端训练,使用对比损失优化特征空间中的类间可分性与类内紧凑性。
实验结果
研究问题
- RQ1能否通过利用身体关节的语义层次,设计一种分层图神经网络架构,有效从原始骨骼序列中建模内在步态模式?
- RQ2在具有挑战性的条件下,是否通过在特征级融合轮廓图与骨骼图特征,能显著提升性能,优于单模态或弱融合方法?
- RQ3MSGG网络的多尺度设计在应对服装与视角变化时,如何提升模型鲁棒性?
- RQ4与独立处理各尺度相比,跨尺度信息传递在多大程度上改善了特征表征?
- RQ5所提出的双模态融合策略是否能超越仅将骨骼作为定位线索的现有多模态步态识别方法?
主要发现
- 所提出的MSGG网络在基于骨骼的步态识别方法中表现卓越,证明了对骨骼数据进行分层多尺度建模的有效性。
- 在CASIA-B数据集上,BiFusion网络在最具有挑战性的条件(穿不同衣服行走)下实现了92.1%的rank-1准确率,显著优于先前的最先进方法。
- 双模态融合策略在跨服装条件下使rank-1准确率相比仅使用轮廓图的基线方法(GaitPart)提升了+12.6%,凸显了互补特征融合的价值。
- 多尺度结构带来逐步性能提升:在关节级分支基础上增加肢体与身体部位层级,分别使准确率提升+3.8%(NM)与+5.9%(BG),表明分层建模具有显著优势。
- 跨尺度信息传递贡献显著,在CL条件下相比未进行跨尺度聚合的特征拼接方法,准确率提升了+9.7%。
- 消融实验验证了所提出的金字塔结构与语义节点划分策略对性能的关键作用,完整MSGG结构(关节+肢体+身体部位)取得了最佳结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。