[论文解读] Fooling Object Detectors: Adversarial Attacks by Half-Neighbor Masks
本文提出HNM-PGD,一种针对目标检测器的新型对抗性攻击方法,通过使用半邻域掩码扰动,在严格ℓ₀约束(≤2%像素,≤10个连通区域)下生成高效且稀疏的对抗性样本。该方法通过显著性引导的掩码生成与投影梯度下降自动识别最优扰动区域,在CIKM 2020 AnalytiCup竞赛中取得前1%成绩,同时揭示了具有语义意义的扰动,暴露了检测器的脆弱性。
Although there are a great number of adversarial attacks on deep learning based classifiers, how to attack object detection systems has been rarely studied. In this paper, we propose a Half-Neighbor Masked Projected Gradient Descent (HNM-PGD) based attack, which can generate strong perturbation to fool different kinds of detectors under strict constraints. We also applied the proposed HNM-PGD attack in the CIKM 2020 AnalytiCup Competition, which was ranked within the top 1% on the leaderboard. We release the code at https://github.com/YanghaoZYH/HNM-PGD.
研究动机与目标
- 在扰动稀疏性与连通性方面施加严格ℓ₀约束的前提下,开发一种实用且自动化的对抗性攻击框架用于目标检测器。
- 解决当前缺乏有效针对目标检测系统(在自动驾驶、身份认证等高安全性应用中日益普及)的对抗性攻击方法的问题。
- 生成既稀疏又具有语义一致性的对抗性补丁,揭示检测器脆弱性的内在机制。
- 在有限扰动预算下提升攻击成功率,同时保持对未见模型的高迁移性。
提出的方法
- 该方法基于SmoothGrad生成显著性图,以识别对扰动最具影响力的图像区域。
- 通过迭代应用形态学操作于显著性图,构建半邻域(HN)掩码,确保满足连通性与稀疏性约束。
- 通过控制参数φ动态调整HN掩码,以平衡显著性与约束符合度。
- 利用带逐元素掩码乘法的投影梯度下降(PGD)生成对抗性噪声,将扰动限制在识别出的区域内。
- 在白盒设置下应用攻击,结合YOLOv4与Faster R-CNN的联合损失以增强迁移性。
- 通过自适应步长与迭代次数优化框架,并使用数据增强技术测试以提升黑盒泛化能力。
实验结果
研究问题
- RQ1能否在无需人工设计的情况下,有效且自动地为目标检测器生成ℓ₀约束下的对抗性攻击?
- RQ2连通性与稀疏性约束如何影响目标检测中对抗性补丁的成功率与迁移性?
- RQ3在ℓ₀约束下的对抗性扰动是否能揭示语义上合理的模式,从而暴露模型弱点?
- RQ4所提出方法是否能在严格约束下于真实世界基准(如CIKM 2020 AnalytiCup)中实现高性能?
主要发现
- HNM-PGD攻击在CIKM 2020 AnalytiCup中取得最终得分2414.87分,位列1000多支队伍中的第17名,进入排行榜前1%。
- 该攻击在ℓ₀约束(≤2%扰动像素,≤10个连通区域)下成功欺骗了YOLOv4与Faster R-CNN。
- Faster R-CNN在像素预算较高时表现更优,因其置信度阈值较低(0.3);而YOLOv4的性能稳定在约53分左右。
- 该方法生成的对抗性补丁精准作用于敏感物体部位,并包含清晰的语义内容,表明显著性与检测器脆弱性之间存在深层关联。
- 使用数据增强(如翻转、裁剪)提升了对黑盒模型的泛化能力,增强了迁移性。
- 线性形状的扰动比块状扰动更有效,因其能影响更广泛的卷积核输出。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。