Skip to main content
QUICK REVIEW

[论文解读] Gait Recognition via Disentangled Representation Learning

Ziyuan Zhang, Luan Tran|arXiv (Cornell University)|Apr 9, 2019
Gait Recognition and AnalysisEngineering参考文献 42被引用 19
一句话总结

该论文提出GaitNet,一种基于自编码器的深度学习框架,通过新颖的重建损失和相似性损失函数,从RGB视频中解耦姿态相关的步态特征与外观变化(如衣物、携带物品)的影响。通过利用多层LSTM聚合时序姿态特征,GaitNet在CASIA-B、USF以及一个新的正面视角步态数据集(FVG)上实现了最先进性能,展现出优于先前方法的优越鲁棒性和计算效率。

ABSTRACT

Gait, the walking pattern of individuals, is one of the most important biometrics modalities. Most of the existing gait recognition methods take silhouettes or articulated body models as the gait features. These methods suffer from degraded recognition performance when handling confounding variables, such as clothing, carrying and view angle. To remedy this issue, we propose a novel AutoEncoder framework to explicitly disentangle pose and appearance features from RGB imagery and the LSTM-based integration of pose features over time produces the gait feature. In addition, we collect a Frontal-View Gait (FVG) dataset to focus on gait recognition from frontal-view walking, which is a challenging problem since it contains minimal gait cues compared to other views. FVG also includes other important variations, e.g., walking speed, carrying, and clothing. With extensive experiments on CASIA-B, USF and FVG datasets, our method demonstrates superior performance to the state of the arts quantitatively, the ability of feature disentanglement qualitatively, and promising computational efficiency.

研究动机与目标

  • 解决在衣物、携带物品和视角变化等干扰视觉因素下的步态识别挑战。
  • 克服手工设计特征(如GEI和基于骨骼的方法)对外观变化敏感或计算成本过高的局限性。
  • 开发一种端到端的深度学习框架,自动从原始RGB视频中解耦与步态相关的关键点动态与静态外观因素。
  • 收集并发布一个高分辨率、正面视角的步态数据集(FVG),涵盖多样化变化,以更好地评估真实场景下的鲁棒性。
  • 证明解耦表征学习可生成更具不变性和泛化能力的步态特征,从而提升识别准确率与效率。

提出的方法

  • GaitNet采用基于CNN的自编码器,包含两个并行分支:一个用于姿态特征,一个用于外观特征,通过交叉重建损失进行训练,以确保特征解耦。
  • 交叉重建损失确保:某帧的外观与另一帧的姿态可重建出后者,从而强制实现解耦。
  • 引入步态相似性损失,确保同一主体在不同条件(如衣物、速度)下的姿态特征保持相似,促进不变性。
  • 通过将解耦后的姿态特征序列输入多层LSTM,并引入增量身份损失,学习时序步态特征,增强判别能力。
  • 最终的步态表征通过视频级特征之间的余弦相似度获得,实现高效的视频间匹配。
  • 该方法在CASIA-B、USF以及新收集的正面视角步态数据集(FVG)上进行训练与评估,并通过消融实验验证各组件的有效性。

实验结果

研究问题

  • RQ1端到端的深度学习模型是否能有效解耦RGB视频中与步态相关的关键点动态与视觉外观变化,而无需依赖手工设计特征?
  • RQ2所提出的解耦框架在衣物、携带物品和视角变化等挑战性条件下的准确率与鲁棒性方面,相较于最先进方法表现如何?
  • RQ3该方法在不同数据集上的泛化能力如何,包括新收集的、涵盖多样化真实世界变化的正面视角步态数据集?
  • RQ4使用新型自编码器与双损失函数(重建损失与相似性损失)是否能生成比现有方法更具不变性与判别力的步态表征?
  • RQ5与基于姿态估计的基线方法相比,该方法的计算效率如何,尤其在实时应用中?

主要发现

  • 在CASIA-B数据集上,GaitNet在CL变化(衣物变化)条件下实现TDR@FAR为91.8%,显著优于次佳方法(LB网络为61.6%),展现出对外观变化的强鲁棒性。
  • 在USF数据集上,GaitNet在探测视角变化条件下实现99.5±0.2%的识别准确率,超过LB网络报告的96.7%和多任务GAN的94.7%。
  • 在新收集的FVG数据集上,GaitNet在所有变化条件下实现81.2%的TDR@FAR 1%,优于GEI(5.8%)、GEINet(13.0%)、DCNN(7.9%)和LB(40.7%)在相同协议下的表现。
  • GaitNet展现出卓越的计算效率,FVG数据集上每帧总推理时间为1.5 ms,快于基于姿态估计的基线方法(如PE-LSTM的22.5 ms/帧)。
  • 消融实验表明,交叉重建损失与步态相似性损失均对解耦与性能至关重要,任一损失的移除均导致准确率显著下降。
  • 定性分析表明,GaitNet成功将姿态动态与外观解耦,生成的特征聚焦于步态运动,即使在携带物品或穿着不同衣物等极端变化下也保持有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。