[论文解读] Learning Human Pose Models from Synthesized Data for Robust RGB-D Action Recognition
本文提出人体姿态模型(HPMs),通过使用3D人体模型、生成对抗网络(GANs)对齐真实与合成图像分布,并利用卷积神经网络(CNNs)提取视角与外观不变的特征,从合成的RGB-D数据中学习人体姿态的视角与外观不变表征。该方法通过利用大规模、多样化的合成训练数据以及傅里叶时间金字塔进行时序建模,在跨视角与跨被试的RGB-D动作识别基准上实现了最先进性能。
We propose Human Pose Models that represent RGB and depth images of human poses independent of clothing textures, backgrounds, lighting conditions, body shapes and camera viewpoints. Learning such universal models requires training images where all factors are varied for every human pose. Capturing such data is prohibitively expensive. Therefore, we develop a framework for synthesizing the training data. First, we learn representative human poses from a large corpus of real motion captured human skeleton data. Next, we fit synthetic 3D humans with different body shapes to each pose and render each from 180 camera viewpoints while randomly varying the clothing textures, background and lighting. Generative Adversarial Networks are employed to minimize the gap between synthetic and real image distributions. CNN models are then learned that transfer human poses to a shared high-level invariant space. The learned CNN models are then used as invariant feature extractors from real RGB and depth frames of human action videos and the temporal variations are modelled by Fourier Temporal Pyramid. Finally, linear SVM is used for classification. Experiments on three benchmark cross-view human action datasets show that our algorithm outperforms existing methods by significant margins for RGB only and RGB-D action recognition.
研究动机与目标
- 解决在视角、光照、衣物和背景等挑战性变化下的鲁棒人体动作识别问题。
- 开发一种可扩展的方法,用于生成大规模、多样化的合成RGB-D训练数据,以捕捉与动作无关的因素。
- 使用深度卷积神经网络(CNNs)学习对视角、体型、纹理和光照不变的人体姿态表征。
- 利用傅里叶时间金字塔对不变姿态特征的时序动态进行建模,以提升动作分类性能。
- 在基准RGB-D动作识别数据集上,验证合成数据与不变特征学习的有效性。
提出的方法
- 从CMU MoCap数据库的动作捕捉骨骼数据中,通过聚类提取具有代表性的身体姿态。
- 将具有不同体型的合成3D人体模型拟合到每种姿态,并在180个相机视角下渲染,同时随机化衣物、背景和光照条件。
- 训练生成对抗网络(GANs)以最小化真实与合成RGB和深度图像之间的分布差异。
- 训练卷积神经网络(CNNs)将输入的RGB和深度图像映射到共享的、高层的不变姿态空间,使用最终Softmax层之前的特征作为姿态表征。
- 利用傅里叶时间金字塔对不变姿态特征的时序变化进行建模,以捕捉动作动态。
- 在时序特征序列上使用线性SVM进行最终的动作分类。
实验结果
研究问题
- RQ1合成数据生成能否有效建模人体姿态的多样化变化(如视角、衣物和光照),从而提升动作识别的鲁棒性?
- RQ2GAN在多大程度上能够弥合真实与合成RGB-D图像之间的域差距,以训练出不变的姿态模型?
- RQ3当在合成数据上进行训练时,基于CNN的人体姿态模型在不同相机视角和被试之间泛化能力如何?
- RQ4不变姿态特征与傅里叶时间金字塔的结合是否能提升在跨视角与跨被试基准上的动作识别性能?
- RQ5即使在预训练于大规模真实数据集的情况下,合成数据能否显著提升C3D和LRCN等现有模型的性能?
主要发现
- 所提方法在三个基准跨视角RGB-D动作识别数据集上优于现有最先进方法,实现了显著的准确率提升。
- 在UCF-101人体运动子集上,HPM模型在使用两倍合成训练数据的情况下达到了84.6%的准确率,接近C3D的84.8%性能,尽管仅使用了数十万帧而非数百万视频帧。
- HPM模型的参数量仅为C3D的约七分之一,展示了在高性能下极高的参数效率。
- 即使在预训练于大规模真实数据集后,使用合成数据仍显著提升了C3D和LRCN的性能,表明受控且多样化的数据增强具有重要价值。
- 傅里叶时间金字塔能有效建模不变姿态特征的时序动态,有助于实现鲁棒的动作分类。
- 基于GAN的合成图像优化显著提升了图像的真实感与与真实数据的分布相似性,从而增强了下游模型的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。