Skip to main content
QUICK REVIEW

[论文解读] A Deep Learning-based Multimodal Depth-Aware Dynamic Hand Gesture Recognition System

Hasan Mahmud, Mashrur M. Morshed|arXiv (Cornell University)|Jul 6, 2021
Hand Gesture Recognition Systems被引用 9
一句话总结

本论文提出了一种用于动态手势识别的深度感知多模态融合方法,采用量化深度图与2D手部骨骼序列。通过应用一种新颖的深度量化技术(gVar)以增强手部区域的对比度,并对CRNN架构进行归一化与正则化优化,该方法在DHG-14/28数据集上达到90.21%的准确率,在SHREC’17数据集上达到93.33%,显著优于先前的多模态CRNN方法,同时参数量更少、输入分辨率更低。

ABSTRACT

The dynamic hand gesture recognition task has seen studies on various unimodal and multimodal methods. Previously, researchers have explored depth and 2D-skeleton-based multimodal fusion CRNNs (Convolutional Recurrent Neural Networks) but have had limitations in getting expected recognition results. In this paper, we revisit this approach to hand gesture recognition and suggest several improvements. We observe that raw depth images possess low contrast in the hand regions of interest (ROI). They do not highlight important fine details, such as finger orientation, overlap between the finger and palm, or overlap between multiple fingers. We thus propose quantizing the depth values into several discrete regions, to create a higher contrast between several key parts of the hand. In addition, we suggest several ways to tackle the high variance problem in existing multimodal fusion CRNN architectures. We evaluate our method on two benchmarks: the DHG-14/28 dataset and the SHREC'17 track dataset. Our approach shows a significant improvement in accuracy and parameter efficiency over previous similar multimodal methods, with a comparable result to the state-of-the-art.

研究动机与目标

  • 解决现有多模态融合CRNN在动态手势识别中泛化能力差、方差高的问题,尤其是在小样本数据集上的表现。
  • 通过增强深度图像中手部感兴趣区域的对比度,改善特征表示,特别是针对细粒度手势。
  • 通过架构正则化与高效融合策略降低模型复杂度与过拟合风险,同时不牺牲性能。
  • 证明输入级预处理(深度量化)在多模态手势识别中可带来比架构复杂度更大的性能提升。

提出的方法

  • 提出一种新颖的深度量化方法(gVar),将连续的深度值映射为离散等级,以增强手指、手掌和指节等手部部件之间的对比度。
  • 在将原始深度图像输入2D-CNN进行空间特征提取前,应用gVar变换,以增强手指重叠与朝向等细节的可见性。
  • 设计一种轻量化、正则化的多模态CRNN架构,引入批量归一化、dropout与SiLU激活函数,以减少过拟合与内部协变量偏移。
  • 通过拼接操作实现深度图与2D骨骼特征的特征级融合,随后利用双向LSTM进行时序建模。
  • 通过消融实验优化学习率、批量大小与dropout率等超参数,以在准确率与泛化能力之间取得平衡。
  • 采用低分辨率输入(112×112)处理深度图与2D骨骼序列,以提升效率,同时保持高性能。

实验结果

研究问题

  • RQ1在使用原始深度图时,深度量化是否能显著提升动态手势识别中的特征表示?
  • RQ2在小样本数据集上,架构正则化与归一化在多模态融合CRNN中在多大程度上可降低方差与过拟合?
  • RQ3与评分级融合相比,深度图与2D骨骼模态的特征级融合在准确率与参数效率方面是否更具优势?
  • RQ4所提方法在标准基准数据集(如DHG-14/28与SHREC’17)上与最先进模型相比表现如何?
  • RQ5为何现有多模态CRNN在28类手势识别中表现不佳?该问题能否通过输入预处理与模型简化得到缓解?

主要发现

  • 所提出的gVar-FL-Fusion模型在DHG-14/28数据集(14类手势)上达到90.21%的准确率,较先前最先进多模态CRNN(85.46%)提升4.75%。
  • 在SHREC’17数据集上,模型对14类手势达到93.33%准确率,对28类手势达到90.24%准确率,优于所有先前的多模态融合方法,并接近最先进水平。
  • 仅gVar预处理本身在SHREC’17数据集上即带来1.43%的准确率增益,证明其在增强深度图像判别性特征方面具有关键作用。
  • 移除BatchNorm层导致性能下降最大(降低1.43%),凸显其在稳定训练与减少内部协变量偏移方面的重要性。
  • 模型仅使用120万参数即实现优异性能,相比先前多模态CRNN减少20–30%参数量,同时保持或超越准确率。
  • 混淆矩阵分析显示Grab与Pinch手势存在持续误分类,这是该领域已知挑战,表明细粒度手势区分仍是关键开放问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。