Skip to main content
QUICK REVIEW

[论文解读] RSA: Randomized Simulation as Augmentation for Robust Human Action Recognition

Yi Zhang, Xinyue Wei|arXiv (Cornell University)|Dec 3, 2019
Human Pose and Action Recognition参考文献 49被引用 7
一句话总结

本文提出随机化模拟作为增强(RSA),一种通过使用受控3D模拟生成的大规模随机合成视频来增强真实视频数据集的框架,以提升人体动作识别的鲁棒性。通过利用微调和领域对抗训练等域适应技术,RSA显著提升了I3D模型在NTU RGB+D和VIRAT数据集上的性能,同时减少了对标注真实数据的依赖,在具有挑战性的监控数据上实现了最高9.09%的准确率提升。

ABSTRACT

Despite the rapid growth in datasets for video activity, stable robust activity recognition with neural networks remains challenging. This is in large part due to the explosion of possible variation in video -- including lighting changes, object variation, movement variation, and changes in surrounding context. An alternative is to make use of simulation data, where all of these factors can be artificially controlled. In this paper, we propose the Randomized Simulation as Augmentation (RSA) framework which augments real-world training data with synthetic data to improve the robustness of action recognition networks. We generate large-scale synthetic datasets with randomized nuisance factors. We show that training with such extra data, when appropriately constrained, can significantly improve the performance of the state-of-the-art I3D networks or, conversely, reduce the number of labeled real videos needed to achieve good performance. Experiments on two real-world datasets NTU RGB+D and VIRAT demonstrate the effectiveness of our method.

研究动机与目标

  • 为解决由于视角、光照和背景等干扰因素导致的人体动作识别中类内差异大的挑战。
  • 通过利用合成数据生成技术,减少对大规模、昂贵的真实世界视频标注的依赖。
  • 通过有效的域适应策略,弥合合成视频与真实视频域之间的现实差距。
  • 在多样化干扰因素条件下,提升最先进I3D网络的泛化能力和鲁棒性。
  • 证明合成数据增强可显著减少实现高性能所需标注的真实视频数量。

提出的方法

  • 使用来自动作捕捉库、RGB-D视频或单目3D姿态估计的3D人体动作数据,生成大规模合成视频数据。
  • 在渲染过程中随机化干扰因素(如相机视角、背景和演员外观),以增加域的多样性。
  • 使用真实数据与合成数据的组合,训练3D卷积神经网络(I3D),以提升鲁棒性。
  • 应用两种域适应策略:(1) 在合成数据上预训练,然后在真实数据上微调;(2) 使用领域对抗训练以最小化特征分布差异。
  • 利用领域对抗训练对齐真实与合成域的特征,减少域偏移。
  • 利用视频中的时序一致性,提升从RGB或RGB-D输入中进行动作捕捉的姿态估计精度。

实验结果

研究问题

  • RQ1具有随机化干扰因素的合成视频数据是否能提升动作识别模型对真实世界变化的鲁棒性?
  • RQ2域适应在缓解合成与真实视频域之间现实差距方面的有效性如何?
  • RQ3合成数据在多大程度上能减少实现高性能所需标注的真实视频数量?
  • RQ4所提出方法是否能泛化到VIRAT等具有挑战性且资源有限的数据集?
  • RQ5在跨域动作识别中,哪种域适应策略——微调还是领域对抗训练——表现更优?

主要发现

  • 在VIRAT数据集上,采用领域对抗训练的RSA将准确率从仅使用真实数据的46.01%提升至55.10%,提升9.09%。
  • 在NTU RGB+D数据集上,RSA在仅使用真实数据训练的I3D模型基础上实现了性能提升,表明在多种干扰因素下具有鲁棒性增益。
  • 在VIRAT上,领域对抗训练优于微调,可能是因为真实数据不足,难以实现有效的微调。
  • 仅在合成数据上训练的模型在某些类别(如“进入”和“打开”)上优于仅使用真实数据训练的模型,表明尽管存在现实差距,仍能学习到有用特征。
  • RSA-DA在所有动作类别上的F1分数均有所提升,其中“进入”和“退出”类别的提升最大,这两类通常难以识别。
  • LOS0划分实验显示,准确率从52.97%下降至46.01%,下降6.96%,证实了干扰因素变化带来的显著挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。