Skip to main content
QUICK REVIEW

[论文解读] Sparse Adversarial Video Attacks with Spatial Transformations

Ronghui Mu, Wenjie Ruan|arXiv (Cornell University)|Nov 10, 2021
Adversarial Robustness in Machine Learning参考文献 58被引用 9
一句话总结

该论文提出 DeepSAVA,一种稀疏对抗性视频攻击方法,通过贝叶斯优化与随机梯度下降(SGD)联合优化加性噪声和空间变换(如旋转、缩放),以识别最具影响力的帧。通过使用结构相似性(SSIM)而非 ℓp-范数来衡量感知保真度,DeepSAVA 在仅扰动单帧的情况下,实现了高达 100% 的攻击成功率,且在多种视频模型间保持了高迁移性,达到当前最先进水平。

ABSTRACT

In recent years, a significant amount of research efforts concentrated on adversarial attacks on images, while adversarial video attacks have seldom been explored. We propose an adversarial attack strategy on videos, called DeepSAVA. Our model includes both additive perturbation and spatial transformation by a unified optimisation framework, where the structural similarity index (SSIM) measure is adopted to measure the adversarial distance. We design an effective and novel optimisation scheme which alternatively utilizes Bayesian optimisation to identify the most influential frame in a video and Stochastic gradient descent (SGD) based optimisation to produce both additive and spatial-transformed perturbations. Doing so enables DeepSAVA to perform a very sparse attack on videos for maintaining human imperceptibility while still achieving state-of-the-art performance in terms of both attack success rate and adversarial transferability. Our intensive experiments on various types of deep neural networks and video datasets confirm the superiority of DeepSAVA.

研究动机与目标

  • 为解决现有对抗性视频攻击方法在保持人类难以察觉的同时难以实现高成功率的问题。
  • 克服基于 ℓp-范数的保真度度量指标的局限性,这些指标无法捕捉如相机抖动或旋转等自然空间变换。
  • 通过识别并仅扰动视频序列中最关键的帧,实现稀疏攻击。
  • 提升对抗性攻击在多种视频模型(包括 LSTM、GRU 等循环架构及 I3D、Inception-v3 等 CNN 模型)间的迁移能力。
  • 开发一种统一的优化框架,联合学习加性扰动与空间变换,以生成更强且更逼真的对抗性样本。

提出的方法

  • 提出一种统一的优化框架,联合学习加性扰动与空间变换(如旋转、缩放),以在最小化感知可见性的同时最大化攻击成功率。
  • 使用贝叶斯优化(BO)迭代识别视频中最具影响力的帧,这些帧在被扰动时能带来最高的攻击成功率。
  • 对选定帧应用随机梯度下降(SGD)以优化加性噪声与空间变换参数。
  • 采用结构相似性指数度量(SSIM)作为主要指标评估对抗距离,确保在感知保真度上优于 ℓp-范数。
  • 通过交替使用基于 BO 的帧选择与基于 SGD 的扰动生成,实现效率与有效性的平衡。
  • 在 UCF101 与 HMDB51 数据集上,使用 I3D、Inception-v3、LSTM、GRU 与普通 RNN 等多种模型对方法进行评估。

实验结果

研究问题

  • RQ1统一的优化框架能否有效结合加性噪声与空间变换,以生成更具真实感与有效性的对抗性视频攻击?
  • RQ2将 ℓp-范数替换为 SSIM 作为保真度度量,是否能生成更符合人类感知、更贴近真实世界视频失真的对抗性样本?
  • RQ3贝叶斯优化能否有效识别视频序列中最关键的帧,以实现高成功率的稀疏攻击?
  • RQ4所提方法在多种视频模型(尤其是 LSTM 与 GRU 等循环架构)间的迁移性能如何?
  • RQ5该方法能否在极小帧扰动(如仅扰动一帧)下实现高攻击成功率,同时保持高迁移性?

主要发现

  • DeepSAVA 仅扰动一帧即在 I3D 模型上实现 100% 的攻击成功率,展现出极高的稀疏性与有效性。
  • 在 UCF101 数据集上,DeepSAVA 在仅扰动一帧的情况下,对多种模型的攻击成功率均达到 99.5% 至 100%,显著优于当前最先进基线方法。
  • 该方法展现出强大的迁移能力:当从白盒 LSTM 攻击生成对抗样本攻击普通 RNN 时,欺骗率高达 82.40%,优于基线方法 Sparse。
  • 基于 RNN 模型(LSTM、GRU)生成的对抗样本在其他 RNN 模型上的迁移率较高(约 85%),表明其在记忆增强架构间具有鲁棒性。
  • 与 ℓp-范数相比,使用 SSIM 生成的对抗样本对自然空间变换(如旋转、缩放)更具鲁棒性,显著提升了感知真实感。
  • 与 Sparse 基线相比,DeepSAVA 在 UCF101 上所有目标模型上均实现了更高的欺骗率,包括 LSTM 上的 85.34% 与普通 RNN 上的 54.62%,证明其迁移能力更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。