Skip to main content
QUICK REVIEW

[论文解读] Synthetic Video Generation for Robust Hand Gesture Recognition in Augmented Reality Applications

Varun Jain, Shivam Aggarwal|arXiv (Cornell University)|Nov 4, 2019
Human Pose and Action Recognition参考文献 9被引用 5
一句话总结

本文提出了一种基于生成对抗网络(GAN)的框架,用于生成具有精确手势标注的逼真合成第一视角视频,通过CycleGAN和前景-背景场景组合技术,在无需深度传感器的情况下实现增强现实/虚拟现实(AR/VR)中鲁棒的手势识别。该方法生成的视频具有高保真度,背景多样且指尖定位一致,显著减少了对昂贵真实世界数据采集的依赖。

ABSTRACT

Hand gestures are a natural means of interaction in Augmented Reality and Virtual Reality (AR/VR) applications. Recently, there has been an increased focus on removing the dependence of accurate hand gesture recognition on complex sensor setup found in expensive proprietary devices such as the Microsoft HoloLens, Daqri and Meta Glasses. Most such solutions either rely on multi-modal sensor data or deep neural networks that can benefit greatly from abundance of labelled data. Datasets are an integral part of any deep learning based research. They have been the principal reason for the substantial progress in this field, both, in terms of providing enough data for the training of these models, and, for benchmarking competing algorithms. However, it is becoming increasingly difficult to generate enough labelled data for complex tasks such as hand gesture recognition. The goal of this work is to introduce a framework capable of generating photo-realistic videos that have labelled hand bounding box and fingertip that can help in designing, training, and benchmarking models for hand-gesture recognition in AR/VR applications. We demonstrate the efficacy of our framework in generating videos with diverse backgrounds.

研究动机与目标

  • 解决AR/VR应用中用于手势识别的大规模、多样化且完全标注的真实世界数据集稀缺的问题。
  • 通过生成模拟真实世界光照、背景和手势姿态多样性的合成数据,减少对昂贵深度传感器和多相机系统的依赖。
  • 开发一种可扩展的端到端视频生成流水线,生成时间上一致、逼真的视频,并附带精确的手部边界框和指尖标注。
  • 通过整合真实世界数据增强和对抗性训练,减轻合成数据与真实数据之间的域偏移。
  • 通过合成数据实现仅使用RGB的深度学习模型的训练,从而支持更简单、更具泛化能力的模型。

提出的方法

  • 该框架使用基于CycleGAN的图像到图像翻译网络,在不同背景领域之间转移手部和指尖外观,同时保持空间一致性。
  • 前景生成通过Turkoglu等人提出的预训练模型完成,用于提取并重新定位手部掩码,确保帧间几何结构和肤色的一致性。
  • 通过基于手势特定掩码的仿射变换,按顺序将前景手部与多样化背景图像进行合成。
  • 生成器采用PatchGAN判别器,以增强局部真实感,减少伪影并提高生成帧的视觉保真度。
  • 采用HSV空间中的肤色分割和基于GrabCut的前景提取方法,以准确隔离手部区域,实现高质量合成。
  • 通过对手部掩码应用基于方向的仿射变换,系统支持时间序列生成,可实现如圆形指向等动态手势序列。

实验结果

研究问题

  • RQ1基于GAN的框架能否生成逼真、多样化且时间一致的第一视角视频,并附带精确的手部和指尖标注?
  • RQ2该方法生成的合成数据在多大程度上能减少域偏移,并提升基于RGB的手势识别模型的泛化能力?
  • RQ3该框架能否仅使用单个参考掩码和空间变换生成复杂手势序列(如圆形指向)?
  • RQ4在视觉保真度和伪影抑制方面,该方法生成的视频质量与标准CycleGAN相比如何?
  • RQ5在训练过程中引入少量真实样本,能否进一步缩小合成数据与真实数据之间的域差距?

主要发现

  • 该框架成功生成了视觉伪影极少的逼真视频,即使在从鹅卵石路面到网球场等差异极大的领域之间转换时也表现良好。
  • 生成图像在帧间保持了稳定的手部和指尖定位,无明显失真或错位。
  • 与标准CycleGAN相比,该方法在保留细节和减少颜色不一致性(尤其是肤色)方面表现更优,尤其在多样化背景下。
  • 通过对手部掩码应用基于方向的仿射变换,系统能够生成如圆形指向等连贯的手势序列,展现出良好的时间一致性。
  • 在合成数据中加入少量真实样本进行训练,显著提升了模型的泛化能力,有效缓解了域偏移问题。
  • 该方法可生成大规模、完全标注的视频数据集,可用于训练鲁棒的无深度传感器手势识别模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。