Skip to main content
QUICK REVIEW

[论文解读] Temporally-Transferable Perturbations: Efficient, One-Shot Adversarial Attacks for Online Visual Object Trackers

Krishna Kanth Nakka, Mathieu Salzmann|arXiv (Cornell University)|Dec 30, 2020
Adversarial Robustness in Machine Learning被引用 6
一句话总结

本文提出了一种一次性、时间可迁移的对抗性攻击方法,用于在线视觉目标跟踪器,该方法从目标模板生成单一扰动,并以接近零计算成本将其应用于后续所有搜索帧。与先前工作相比,该方法在标准基准测试中实现了更高的攻击成功率,同时通过预先计算方向性扰动,实现了对目标轨迹的复杂操控。

ABSTRACT

In recent years, the trackers based on Siamese networks have emerged as highly effective and efficient for visual object tracking (VOT). While these methods were shown to be vulnerable to adversarial attacks, as most deep networks for visual recognition tasks, the existing attacks for VOT trackers all require perturbing the search region of every input frame to be effective, which comes at a non-negligible cost, considering that VOT is a real-time task. In this paper, we propose a framework to generate a single temporally transferable adversarial perturbation from the object template image only. This perturbation can then be added to every search image, which comes at virtually no cost, and still, successfully fool the tracker. Our experiments evidence that our approach outperforms the state-of-the-art attacks on the standard VOT benchmarks in the untargeted scenario. Furthermore, we show that our formalism naturally extends to targeted attacks that force the tracker to follow any given trajectory by precomputing diverse directional perturbations.

研究动机与目标

  • 解决现有对抗性攻击在在线视觉目标跟踪器上计算成本过高的问题,这些问题攻击需要逐帧生成扰动。
  • 开发一种一次性攻击策略,仅从目标模板图像中生成单一、可迁移的扰动,并适用于视频中的所有帧。
  • 实现可定向攻击,通过预计算的方向性扰动,使跟踪器沿预设轨迹移动。
  • 在保持在线跟踪场景实时性能的前提下,提升攻击效率与有效性。

提出的方法

  • 训练一个扰动生成器,从目标模板图像中生成单一对抗性扰动,并将其应用于视频序列中的每个搜索区域。
  • 攻击框架使用一个条件生成器,该生成器根据目标方向进行条件控制,以生成多样化的扰动,实现可定向跟踪。
  • 该方法结合了欺骗损失和位移损失的损失函数,以确保扰动能够误导跟踪器,同时保持空间一致性。
  • 扰动每段视频仅生成一次,实现实时应用,模板推理时间仅为8ms。
  • 采用端到端训练方式,结合分类损失与回归损失,以最大化跟踪器的误判率。
  • 在不同主干网络架构(如ResNet、MobileNet、AlexNet)和跟踪器(SiamRPN++、SiamMask、SiamFC)上评估了迁移能力。

实验结果

研究问题

  • RQ1从目标模板中生成的单一、一次性对抗性扰动能否在所有视频帧上有效欺骗在线Siamese结构的视觉目标跟踪器?
  • RQ2所提方法是否在保持实时性能的前提下,相比逐帧攻击实现了更高的攻击成功率?
  • RQ3能否通过条件控制扰动生成器,实现可定向攻击,使跟踪器沿预设轨迹移动?
  • RQ4该攻击在不同跟踪器架构和主干网络上的泛化能力如何?

主要发现

  • 在OTB100数据集上,该方法实现了69.5%的成功率和90.5%的精度,优于当前最先进方法CSA_T(分别为57.3%和78.6%)。
  • 在VOT2018数据集上,该方法实现了65.4%的成功率和86.3%的精度,显著优于CSA_T(57.3%和78.6%)和CSA_S(21.5%和36.4%)。
  • 消融实验表明,位移损失组件对攻击有效性贡献最大,最优性能出现在位移距离d=8时。
  • 迁移能力分析显示,该攻击在SiamMask和SiamRPN++(M)上泛化良好,分别实现了34.7%的成功率和29.4%的成功率,多数情况下优于CSA_T。
  • 该方法保持了实时性能,每段视频仅需8ms生成扰动,支持高效在线部署。
  • 可定向攻击框架通过预计算方向性扰动,实现了复杂轨迹操控,实验中已成功验证其引导能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。