Skip to main content
QUICK REVIEW

[论文解读] SMART: Skeletal Motion Action Recognition aTtack

He Wang, Feixiang He|arXiv (Cornell University)|Nov 16, 2019
Adversarial Robustness in Machine Learning参考文献 44被引用 5
一句话总结

SMART 提出了一种针对 3D 骨骼运动动作识别的新型对抗性攻击方法,通过引入动态感知的感知损失,生成难以察觉的扰动。该方法在多个模型和数据集上实现了 100% 的攻击成功率,同时通过了严格的主观感知研究,表明运动动态在时间序列对抗性攻击中的不可察觉性中起着关键作用。

ABSTRACT

Adversarial attack has inspired great interest in computer vision, by showing that classification-based solutions are prone to imperceptible attack in many tasks. In this paper, we propose a method, SMART, to attack action recognizers which rely on 3D skeletal motions. Our method involves an innovative perceptual loss which ensures the imperceptibility of the attack. Empirical studies demonstrate that SMART is effective in both white-box and black-box scenarios. Its generalizability is evidenced on a variety of action recognizers and datasets. Its versatility is shown in different attacking strategies. Its deceitfulness is proven in extensive perceptual studies. Finally, SMART shows that adversarial attack on 3D skeletal motion, one type of time-series data, is significantly different from traditional adversarial attack problems.

研究动机与目标

  • 研究基于 3D 骨骼运动的动作识别模型在对抗性攻击下的脆弱性。
  • 解决时间序列骨骼运动数据中冗余度低和感知敏感度高的独特挑战。
  • 开发一种感知损失函数,确保对抗性样本在视觉上自然且对人类难以区分。
  • 在多种模型和数据集上,于白盒和黑盒设置下评估该攻击的有效性。
  • 提供实证和感知证据,表明运动动态显著影响不可察觉性,与静态图像对抗攻击存在差异。

提出的方法

  • SMART 采用一种优化框架,联合最小化分类损失(以欺骗动作识别器)和一种新型感知损失(以确保自然性)。
  • 感知损失显式建模运动动态和骨骼结构,利用时间一致性和骨骼长度一致性作为约束条件。
  • 通过调节分类损失与感知损失之间的权衡,实现攻击成功率与不可察觉性的平衡。
  • 通过利用可迁移性和模型无关的扰动生成,支持白盒和黑盒攻击。
  • 攻击作用于 3D 关节坐标,扰动经过优化以保持运动平滑性,避免抖动。
  • 用户研究和感知评估被整合到评估流程中,以验证对抗性运动的真实性。

实验结果

研究问题

  • RQ1尽管存在冗余度低和感知敏感度高的问题,能否使针对 3D 骨骼运动数据的对抗性攻击保持不可察觉?
  • RQ2在时间序列数据中,利用运动动态如何影响对抗性扰动的感知真实性?
  • RQ3SMART 与现有方法相比,在攻击成功率和感知不可区分性方面表现如何?
  • RQ4在受控的感知研究中,人类观察者在多大程度上能检测到骨骼运动序列中的对抗性扰动?
  • RQ5人类感知中是否存在一个‘盲区’,使得运动扰动无法被察觉,而对抗性攻击能否利用这一特性?

主要发现

  • 在白盒设置下,SMART 在 ST-GCN 上实现了 100% 的攻击成功率,优于最先进方法 CIASA。
  • 在感知研究中,平均 81.9% 的用户无法区分对抗性运动与真实运动,MHAD 数据集上的准确率为 83.97%,HDM05 数据集上为 80.83%。
  • 尽管关节偏差更高,用户仍更偏好 SMART 生成的扰动,而非 l2-范数攻击,表明其具有更优的感知真实性。
  • 感知损失通过建模运动动态和骨骼结构,显著提升了不可区分性,而标准的 l-范数约束则不具备此效果。
  • 若运动动态得到妥善保持,即使关节偏差较大,扰动仍可能不可察觉,这挑战了 l-范数是不可察觉性主要衡量标准的假设。
  • 该方法在多种模型(RNN 和 GNN 基于)和数据集(NTU、HDM05、MHAD)中表现出强大的泛化能力,证实了其通用性和鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。