Skip to main content
QUICK REVIEW

[论文解读] Bait and Switch: Online Training Data Poisoning of Autonomous Driving Systems

Naman Patel, P. Krishnamurthy|arXiv (Cornell University)|Nov 8, 2020
Adversarial Robustness in Machine Learning参考文献 21被引用 5
一句话总结

本文提出了一种新颖的无标签数据中毒攻击——'Bait and Switch'——通过在自动驾驶系统在线训练期间对环境进行物理操控,导致深度神经网络在指示牌与交通灯状态之间学习到虚假相关性。当100%的交通灯被污染时,模型准确率下降至33.89%,即使仅微调最后几层,也显示出现实世界在线学习系统中的关键脆弱性。

ABSTRACT

We show that by controlling parts of a physical environment in which a pre-trained deep neural network (DNN) is being fine-tuned online, an adversary can launch subtle data poisoning attacks that degrade the performance of the system. While the attack can be applied in general to any perception task, we consider a DNN based traffic light classifier for an autonomous car that has been trained in one city and is being fine-tuned online in another city. We show that by injecting environmental perturbations that do not modify the traffic lights themselves or ground-truth labels, the adversary can cause the deep network to learn spurious concepts during the online learning phase. The attacker can leverage the introduced spurious concepts in the environment to cause the model's accuracy to degrade during operation; therefore, causing the system to malfunction.

研究动机与目标

  • 研究在在线学习自动驾驶系统上实施物理性、无标签数据中毒攻击的可行性。
  • 探索攻击者如何操控现实环境,以在不修改训练数据或标签的情况下,诱导深度神经网络产生虚假相关性。
  • 评估此类攻击在不同条件下的鲁棒性与泛化能力,包括部分微调和环境变化。
  • 证明即使对训练环境进行最小的物理修改,也能导致部署模型性能显著下降。

提出的方法

  • 攻击者在在线训练阶段于新城市的交通灯附近安装或购买电子广告牌的广告位。
  • 在训练期间,攻击者将特定图像(例如:狗、猫、鱼)与对应的交通灯状态(红、黄、绿)进行同步(诱饵阶段)。
  • 深度神经网络因此学习到广告牌图像与交通灯状态之间的虚假相关性,误将其视为预测特征。
  • 在部署阶段,攻击者将广告牌上的图像与灯色对应关系反转(切换阶段),导致分类错误。
  • 该攻击在CARLA模拟器中进行评估,使用基于深度神经网络的交通灯分类器,该分类器基于带有受控环境扰动的真实世界类似数据进行训练。
  • 该方法评估了在不同条件下的攻击效果:被污染的灯数量、可训练参数数量以及广告牌图像的变化。

实验结果

研究问题

  • RQ1在在线训练期间,通过物理性、无标签的环境修改,是否能在一个基于深度神经网络的交通灯分类器中引发持久的虚假相关性?
  • RQ2当仅在在线学习过程中微调网络的子集层时,该攻击的有效性如何?
  • RQ3该攻击是否能泛化到广告牌位置与训练位置不同的测试场景?
  • RQ4随着暴露于被污染环境刺激的交通灯比例变化,攻击性能如何变化?
  • RQ5广告牌图像的选择是否会影响攻击的成功率?

主要发现

  • 当100%的交通灯均被对抗性广告牌污染时,模型在测试集上的准确率从98.25%下降至33.89%。
  • 即使仅3/37个交通灯被污染,模型在污染位置的准确率也降至77%,整体准确率降至85%,显示出极强的泛化能力。
  • 当仅微调最后的卷积层和全连接层时,攻击依然有效,污染位置的准确率下降至73.7%。
  • 该攻击可泛化至广告牌位置发生偏移的测试场景,保持相似的准确率下降(例如:37个灯中有18个被污染时,准确率为60%)。
  • 不同类型的广告牌图像(如动物、图案)均表现出相近的攻击效果,当18个灯被污染时,准确率从99.28%下降至64%。
  • 即使攻击者未修改训练数据或标签,仅通过物理环境操控,也导致模型性能显著下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。