[论文解读] Automatic learning of gait signatures for people identification
本文提出一种端到端卷积神经网络(CNN),直接从光流特征中学习步态特征,仅使用80×60分辨率的视频帧,在TUM-GAID数据集上实现了最先进性能——分辨率仅为此前方法的八分之一,证明了仅从低层次运动数据中即可有效学习高层步态表征,而无需手工设计的轮廓图或复杂特征工程。
This work targets people identification in video based on the way they walk (i.e. gait). While classical methods typically derive gait signatures from sequences of binary silhouettes, in this work we explore the use of convolutional neural networks (CNN) for learning high-level descriptors from low-level motion features (i.e. optical flow components). We carry out a thorough experimental evaluation of the proposed CNN architecture on the challenging TUM-GAID dataset. The experimental results indicate that using spatio-temporal cuboids of optical flow as input data for CNN allows to obtain state-of-the-art results on the gait task with an image resolution eight times lower than the previously reported results (i.e. 80x60 pixels).
研究动机与目标
- 开发一种端到端深度学习框架用于步态识别,避免使用如二值轮廓图等手工设计特征。
- 探究仅使用光流图是否足以作为输入以学习判别性步态特征。
- 在具有挑战性的TUM-GAID数据集上验证所提方法,涵盖多种条件(服装、背包、视角变化)。
- 证明相较于先前工作,可显著降低输入分辨率的同时仍实现高识别准确率。
- 探索所学习步态特征在辅助任务(如性别识别)中的潜力。
提出的方法
- 从视频序列中提取时空光流立方体作为CNN的输入,避免计算二值轮廓图。
- 设计一种CNN架构,处理3D光流体积以学习分层、判别性步态表征。
- 使用最后一层全连接层的L2归一化特征作为步态特征用于分类。
- 在学习到的特征上应用一对多线性SVM或最近邻分类器进行人员识别。
- 在最近邻分类前对特征进行PCA降维,以省去训练步骤。
- 在三种测试场景下评估模型:正常(N)、携带背包(B)和佩戴围巾(S),以模拟现实世界中的变化。
实验结果
研究问题
- RQ1仅使用光流特征进行训练的CNN是否能在不依赖手工轮廓图的情况下实现最先进步态识别性能?
- RQ2在较低输入分辨率下,所提方法与使用GEI或密集轨迹的经典步态识别方法相比表现如何?
- RQ3所学习的步态特征在服装、携带物品及视角变化下的泛化能力如何?
- RQ4所学习的步态特征是否可有效复用于相关任务(如性别识别)?
- RQ5使用低分辨率输入(80×60)是否会导致识别准确率相比更高分辨率输入下降?
主要发现
- 所提CNN仅使用80×60分辨率的光流输入,在TUM-GAID数据集上实现了98.0%的rank-1准确率,与使用640×480输入的最先进方法相当或更优。
- CNN-SVM变体在所有场景(N、B、S)下平均rank-1准确率达到98.0%,除使用更高分辨率数据的PFM外,优于所有先前方法。
- CNN-NN128分类器在三个测试场景下平均准确率达59.4%,表明非线性分类优于线性SVM,说明步态特征具有非线性可分性。
- 仅使用运动特征(光流)时,模型在性别识别任务中平均准确率达89.0%,优于Hofmann等人[14],尽管输入分辨率更低。
- 混淆矩阵显示,男性受试者识别准确率约为96%,女性受试者约为77%,可能由于数据集中类别不平衡所致。
- 结果证实,仅使用基于光流的特征即可充分学习判别性步态特征,且在视角和外观变化下具有良好的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。