[论文解读] Improving the Robustness of Deep Neural Networks via Adversarial Training with Triplet Loss
本文提出了一种新型防御方法——基于三元组损失的对抗训练(AT²L),通过将三元组损失融入对抗训练,提升了深度神经网络的鲁棒性。通过将对抗样本作为三元组中的锚点,AT²L使决策边界更加平滑,在FGSM、DeepFool和C&W攻击下显著提升了鲁棒性,同时保持了高准确率,强攻击下的错误率最低降至4.6%。
Recent studies have highlighted that deep neural networks (DNNs) are vulnerable to adversarial examples. In this paper, we improve the robustness of DNNs by utilizing techniques of Distance Metric Learning. Specifically, we incorporate Triplet Loss, one of the most popular Distance Metric Learning methods, into the framework of adversarial training. Our proposed algorithm, Adversarial Training with Triplet Loss (AT$^2$L), substitutes the adversarial example against the current model for the anchor of triplet loss to effectively smooth the classification boundary. Furthermore, we propose an ensemble version of AT$^2$L, which aggregates different attack methods and model structures for better defense effects. Our empirical studies verify that the proposed approach can significantly improve the robustness of DNNs without sacrificing accuracy. Finally, we demonstrate that our specially designed triplet loss can also be used as a regularization term to enhance other defense methods.
研究动机与目标
- 为解决深度神经网络对对抗样本的脆弱性问题,该问题对自动驾驶和生物识别等实际应用构成威胁。
- 通过使用度量学习中的距离度量来优化决策边界,超越标准对抗训练,进一步提升对抗鲁棒性。
- 探究三元组损失是否可作为正则化项,以增强现有防御方法。
- 评估基于集成攻击的融合策略在提升防御泛化能力方面的有效性。
提出的方法
- 通过在三元组中使用对抗样本作为锚点,将三元组损失整合到对抗训练中,促进类内紧凑性和类间分离性。
- 修改三元组损失的公式,使用对抗样本作为锚点,确保被错误分类的样本远离正确类别嵌入。
- 提出AT²L的集成版本,结合多种攻击类型(FGSM、DeepFool、C&W)和模型架构,以提升鲁棒性。
- 将所提出的三元组损失作为正则化项应用于其他防御框架(如Defense-GAN),以增强其鲁棒性。
- 采用结合交叉熵损失与三元组损失的损失函数:L_total = L_cross_entropy + λ₁·L_triplet + λ₂·L_reg,其中α=2.0,λ₁=0.3,λ₂=1.0。
- 采用两阶段训练流程:首先使用标准损失进行对抗训练,然后通过三元组正则化进行微调。
实验结果
研究问题
- RQ1将三元组损失集成到对抗训练中,是否能提升对抗鲁棒性?
- RQ2在三元组损失中使用对抗样本作为锚点,是否能带来更平滑的决策边界并实现更好的泛化性能?
- RQ3所提出的三元组损失是否可作为其他防御方法的有效正则化项?
- RQ4基于集成的攻击融合策略如何影响防御模型的鲁棒性?
- RQ5该方法在提升强攻击下鲁棒性的同时,是否仍能保持高自然准确率?
主要发现
- 在原始攻击场景下,AT²L在C&W攻击下将Inception-ResNet-v2的top-1错误率降低至4.6%,而原始模型错误率为100%。
- 在集成模式攻击场景下,AT²L在C&W攻击下于Inception-v3上实现了9.0%的错误率,显著优于原始模型的99.1%错误率。
- AT²L的集成版本在FGSM攻击下将Ens-adv-Inception-ResNet-v2的错误率降低至8.9%,而原始模型为13.8%。
- 当作为正则化项应用于Defense-GAN时,AT²L将模型A在C&W攻击下的错误率从96.5%降低至1.4%,展现出强大的迁移能力。
- 结合随机化层与AT²L可进一步提升鲁棒性,在集成攻击下将Inception-v3在C&W攻击下的错误率降低至7.4%。
- 该方法在显著提升鲁棒性的同时保持了高自然准确率,在所有设置下均仅出现极小的准确率下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。