Skip to main content
QUICK REVIEW

[论文解读] Adversary Helps: Gradient-based Device-Free Domain-Independent Gesture Recognition

Jianwei Liu, Jinsong Han|arXiv (Cornell University)|Apr 8, 2020
Hand Gesture Recognition Systems参考文献 22被引用 5
一句话总结

本文提出 DI,一种基于梯度对抗训练的新型框架,用于无需设备、领域无关的手势识别。通过利用梯度图的符号映射作为领域差距消除器,结合一种新型深度模型(AH-Net),DI 在十种手势和十个领域上实现了 CNN 的最先进准确率 94.45%,优于现有方法,同时避免了其局限性,如手势类型限制或高计算成本。

ABSTRACT

Wireless signal-based gesture recognition has promoted the developments of VR game, smart home, etc. However, traditional approaches suffer from the influence of the domain gap. Low recognition accuracy occurs when the recognition model is trained in one domain but is used in another domain. Though some solutions, such as adversarial learning, transfer learning and body-coordinate velocity profile, have been proposed to achieve cross-domain recognition, these solutions more or less have flaws. In this paper, we define the concept of domain gap and then propose a more promising solution, namely DI, to eliminate domain gap and further achieve domain-independent gesture recognition. DI leverages the sign map of the gradient map as the domain gap eliminator to improve the recognition accuracy. We conduct experiments with ten domains and ten gestures. The experiment results show that DI can achieve the recognition accuracies of 87.13%, 90.12% and 94.45% on KNN, SVM and CNN, which outperforms existing solutions.

研究动机与目标

  • 为解决基于 WiFi 的手势识别中领域差距这一关键挑战,该挑战会导致在某一环境训练的模型在另一环境中部署时准确率下降。
  • 开发一种解决方案,实现真正的领域无关手势识别,而无需依赖手势特定约束或高计算开销。
  • 通过利用源自梯度符号图的对抗样本消除领域差距,确保在多样化环境中具备鲁棒性。
  • 在准确率和泛化能力方面,超越现有方法如 EI、CrossSense、WiAG 和 Widar3.0。

提出的方法

  • 提出 DI 框架,利用一种新型深度神经网络 AH-Net,将领域特定的手势信号转换为领域无关的表征。
  • 采用快速梯度符号法(FGSM)生成对抗样本,利用梯度图的符号作为领域差距消除器(DGE),以最小化领域偏移。
  • 将 DGE 应用于重加权特征表征,使模型在训练过程中学习到领域不变的特征。
  • 使用包含分类损失和通过 DGE 实现的领域差距消除的联合损失函数,端到端训练模型。
  • 在提取领域不变特征后,支持多种分类器(KNN、SVM、CNN)进行手势识别。
  • 使用 t-SNE 可视化确认,DI 处理后,领域特定的聚类被合并为统一的特征空间。

实验结果

研究问题

  • RQ1基于梯度的对抗技术能否在多样化环境中有效消除基于 WiFi 的手势识别中的领域差距?
  • RQ2所提出的 DI 框架是否在准确率上优于现有跨领域手势识别方法?
  • RQ3DI 是否能支持静态手势识别,而这类手势常被基于速度的方法(如 Widar3.0)所排除?
  • RQ4领域差距消除器中的超参数 α 如何影响不同分类器上的模型性能?
  • RQ5DI 框架在计算效率和跨多种手势与领域时的泛化能力方面是否表现良好?

主要发现

  • DI 在 CNN 上实现了 94.45% 的识别准确率,显著优于现有方法如 Widar3.0(92.70%)和 WiAG(91.40%)。
  • 在 KNN 和 SVM 上的准确率分别达到 87.13% 和 90.12%,均超过 EI 和 CrossSense 的性能。
  • CNN 的最优超参数 α 为 0.04,可获得最大准确率;而 KNN 和 SVM 的峰值性能分别在 α = 0.19 时达到。
  • DI 有效消除了领域差距,t-SNE 可视化结果证实,不同领域和手势的聚类在处理后已合并为统一特征空间。
  • DI 支持静态手势识别,而 Widar3.0 因依赖速度特征而无法识别静态手势。
  • DI 避免了手势占比约束,且仅使用少于三个基本学习模型,因此比 CrossSense 更具计算效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。