[论文解读] Over-the-Air Adversarial Flickering Attacks against Video Recognition Networks
本文提出了一种基于物理光调制的空中对抗性闪烁攻击,通过智能RGB灯泡发出的细微、时变RGB光扰动,操纵视频动作识别模型。通过优化不可察觉性和时间不变性,该方法在I3D模型上实现了93%的欺骗率,并在无需视频帧同步的情况下展示了跨模型的现实世界可迁移性。
Deep neural networks for video classification, just like image classification networks, may be subjected to adversarial manipulation. The main difference between image classifiers and video classifiers is that the latter usually use temporal information contained within the video. In this work we present a manipulation scheme for fooling video classifiers by introducing a flickering temporal perturbation that in some cases may be unnoticeable by human observers and is implementable in the real world. After demonstrating the manipulation of action classification of single videos, we generalize the procedure to make universal adversarial perturbation, achieving high fooling ratio. In addition, we generalize the universal perturbation and produce a temporal-invariant perturbation, which can be applied to the video without synchronizing the perturbation to the input. The attack was implemented on several target models and the transferability of the attack was demonstrated. These properties allow us to bridge the gap between simulated environment and real-world application, as will be demonstrated in this paper for the first time for an over-the-air flickering attack.
研究动机与目标
- 开发一种基于物理光调制的现实世界对抗性攻击,用于视频动作识别模型。
- 通过时间平滑性和降低时空粗糙度,确保对抗性扰动对人类观察者不可察觉。
- 将攻击泛化为一种无需与输入视频同步的通用、时间不变的扰动。
- 在真实世界部署中,证明该攻击在不同视频识别模型间的可迁移性。
- 弥合模拟对抗性攻击与视频分类系统中真实物理实现之间的差距。
提出的方法
- 在每一帧上施加统一的RGB扰动,以生成模拟自然光照变化的闪烁时间模式。
- 在优化过程中引入两项正则化项:一项用于时间平滑性(降低闪烁频率),另一项用于振幅控制(最小化可察觉性)。
- 修改对抗性损失函数,联合优化欺骗目标模型和通过正则化最小化可察觉性的目标。
- 构建可泛化至不同动作和场景的通用扰动,实现无需事先了解输入视频的应用。
- 通过Wi-Fi控制的RGB LED灯泡传输对抗性RGB模式,实现空中部署,以调制真实世界光照。
- 使用时间不变的扰动,消除攻击信号与视频输入在帧级别同步的需求。
实验结果
研究问题
- RQ1能否在有效欺骗视频动作识别模型的同时,使闪烁对抗性扰动对人类观察者不可察觉?
- RQ2能否构建一种适用于多样化视频输入、无需同步的通用、时间不变的对抗性扰动?
- RQ3该攻击在真实世界设置中,跨不同视频识别模型的可迁移性达到何种程度?
- RQ4能否成功利用真实照明设备(如智能RGB灯泡)在物理世界中部署该攻击?
- RQ5时间正则化与修改后的对抗性损失相结合,如何提升攻击的不可察觉性和有效性?
主要发现
- 所提出的闪烁攻击在I3D模型上使用通用、时间不变的扰动,实现了93%的欺骗率。
- 当扰动平滑且时间受限时,对人类观察者不可察觉,视频示例已证明这一点。
- 该方法成功实现了通过Wi-Fi控制的RGB LED灯泡进行空中部署,以调制真实世界的光照条件。
- 该攻击在不同视频识别模型间表现出强大的可迁移性,包括Kinetics-400基准中的模型。
- 时间不变的扰动通过消除与输入视频在帧级别同步的需求,实现了真实世界的适用性。
- 即使相机的RGB响应特性与色度串扰不同于理想模型,攻击仍保持有效,证实了其在真实环境下的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。