[论文解读] On Learning Disentangled Representations for Gait Recognition
该论文提出GaitNet,一种基于自编码器的新型深度学习框架,能够从RGB步态视频中解耦外观、标准形态和姿态特征,从而提升在服装和视角等混淆因素下的识别鲁棒性。通过利用LSTM进行时序建模并引入自定义损失函数,GaitNet在CASIA-B、USF以及一个新的正面视角步态数据集(FVG)上实现了最先进性能,相较于现有方法展现出更优的准确率、解耦质量以及计算效率。
Gait, the walking pattern of individuals, is one of the important biometrics modalities. Most of the existing gait recognition methods take silhouettes or articulated body models as gait features. These methods suffer from degraded recognition performance when handling confounding variables, such as clothing, carrying and viewing angle. To remedy this issue, we propose a novel AutoEncoder framework, GaitNet, to explicitly disentangle appearance, canonical and pose features from RGB imagery. The LSTM integrates pose features over time as a dynamic gait feature while canonical features are averaged as a static gait feature. Both of them are utilized as classification features. In addition, we collect a Frontal-View Gait (FVG) dataset to focus on gait recognition from frontal-view walking, which is a challenging problem since it contains minimal gait cues compared to other views. FVG also includes other important variations, e.g., walking speed, carrying, and clothing. With extensive experiments on CASIA-B, USF, and FVG datasets, our method demonstrates superior performance to the SOTA quantitatively, the ability of feature disentanglement qualitatively, and promising computational efficiency. We further compare our GaitNet with state-of-the-art face recognition to demonstrate the advantages of gait biometrics identification under certain scenarios, e.g., long distance/lower resolutions, cross viewing angles.
研究动机与目标
- 解决现有步态识别方法对服装、携带物品和视角等混淆变量敏感的局限性。
- 开发一种端到端深度学习框架,自动从RGB视频中解耦与步态相关特征(标准形态与姿态)以及外观(服装)和非步态因素。
- 收集并发布一个新的正面视角步态数据集(FVG),用于评估在步态线索最少且变化较大的情况下的识别性能。
- 证明解耦表征学习可提升步态识别的鲁棒性与泛化能力,尤其在低分辨率或挑战性观测条件下。
- 在相似条件下与最先进的人脸识别系统对比GaitNet的性能,凸显步态在远距离或非理想场景中的优势。
提出的方法
- GaitNet是一种基于自编码器的CNN,将每帧视频编码为三种解耦的潜在特征:姿态(动态)、标准形态(身份特异性身体形态)和外观(服装/纹理)。
- 模型使用交叉重建损失,确保来自一帧的(标准形态 + 外观)与另一帧的姿态特征能够重建目标帧。
- 姿态相似性损失强制同一主体不同帧之间的姿态特征保持时序一致性,即使在不同条件下亦然。
- 标准形态一致性损失确保同一主体不同视频中的标准形态特征保持稳定,促进身份不变性。
- 姿态特征通过多层LSTM处理以建模时序动态,并应用增量身份损失以增强判别能力。
- 最终的步态表征结合了静态的标准形态特征(时间平均)与动态姿态特征(LSTM处理),联合用于分类。
实验结果
研究问题
- RQ1端到端深度学习模型能否有效从RGB步态视频中解耦与步态相关的特征(标准形态与姿态)以及外观和混淆因素?
- RQ2所提出的解耦框架是否能提升在服装、携带物品、行走速度和视角变化下的识别准确率与鲁棒性?
- RQ3在低分辨率或非正面视角等挑战性条件下,GaitNet的性能与最先进的人脸识别系统相比如何?
- RQ4解耦表征学习在多大程度上提升了在不同数据集和步态模态间的泛化能力?
- RQ5所提出方法能否在计算成本较低的前提下实现高准确率,从而适用于实际部署?
主要发现
- GaitNet在CASIA-B、USF以及新收集的FVG数据集上均达到最先进性能,在各种变化条件下均展现出更高的识别准确率。
- 在FVG数据集上,GaitNet在NM-BGHT协议下达到98.2%的准确率,在NM-ALL*协议下达到97.6%,展现出对服装和配饰变化的强大鲁棒性。
- 即使在分辨率下降和非正面视角条件下,模型仍保持高准确率,而人脸识别则始终表现较差。
- GaitNet计算效率高,在FVG数据集上每帧总推理时间为90.5 ms,优于基于姿态的方法,并与近期基于CNN的步态模型速度相当。
- 定性可视化结果表明,解耦特征具有语义意义:外观特征捕捉服装,标准形态特征反映身体形态,姿态特征追踪运动。
- 在远距离和低分辨率场景中,GaitNet始终优于ArcFace,尤其在侧视或非正面条件下,人脸识别完全失效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。