[论文解读] There is Limited Correlation between Coverage and Robustness for Deep Neural Networks
本文通过25项指标对100个模型进行了实证研究,评估了深度神经网络(DNN)测试覆盖率与鲁棒性之间的关系。研究发现,覆盖率标准与鲁棒性之间相关性有限,挑战了‘更高覆盖率意味着更鲁棒模型’的假设,并为未来DNN测试研究提供了公开基准。
Deep neural networks (DNN) are increasingly applied in safety-critical systems, e.g., for face recognition, autonomous car control and malware detection. It is also shown that DNNs are subject to attacks such as adversarial perturbation and thus must be properly tested. Many coverage criteria for DNN since have been proposed, inspired by the success of code coverage criteria for software programs. The expectation is that if a DNN is a well tested (and retrained) according to such coverage criteria, it is more likely to be robust. In this work, we conduct an empirical study to evaluate the relationship between coverage, robustness and attack/defense metrics for DNN. Our study is the largest to date and systematically done based on 100 DNN models and 25 metrics. One of our findings is that there is limited correlation between coverage and robustness, i.e., improving coverage does not help improve the robustness. Our dataset and implementation have been made available to serve as a benchmark for future studies on testing DNN.
研究动机与目标
- 探究现有DNN测试覆盖率标准是否与安全关键应用中模型的鲁棒性相关。
- 评估在使用测试数据微调后,覆盖率提升与鲁棒性增强之间的关系。
- 识别与鲁棒性或鲁棒性提升强相关的指标,以提供更优的测试指导。
- 基于真实世界模型和对抗样本,建立全面且可复现的DNN测试研究基准。
提出的方法
- 在MNIST和CIFAR-10数据集上,使用多种架构训练了100个最先进的DNN模型。
- 使用三种最先进的攻击方法(FGSM、JSMA和C&W)生成对抗样本,以构建多样化的训练集。
- 实现了并评估了10余种覆盖率标准,包括神经元覆盖率、DeepGauge、MC/DC和惊喜充分性。
- 使用两项指标衡量鲁棒性:CLEVER分数以及在多种攻击下的对抗攻击成功率。
- 通过皮尔逊相关系数和斯皮尔曼等级相关系数分析,对25项指标进行相关性分析,以评估覆盖率、鲁棒性及改进之间的关系。
- 将所有模型、对抗样本及代码作为公开基准发布,供未来DNN测试研究使用。
实验结果
研究问题
- RQ1测试覆盖率标准与DNN鲁棒性之间是否存在相关性?
- RQ2不同覆盖率标准之间是否存在相关性?
- RQ3在微调后,覆盖率标准的提升与鲁棒性提升之间是否存在相关性?
- RQ4是否存在与DNN鲁棒性或微调后鲁棒性提升强相关的指标?
主要发现
- 覆盖率标准(如神经元覆盖率、DeepGauge)与DNN鲁棒性之间存在有限甚至无显著相关性,挑战了覆盖率驱动测试的基本假设。
- 通过微调提升覆盖率并不能一致地改善鲁棒性,如CLEVER分数和对抗攻击成功率所衡量的那样。
- 即使使用MC/DC和惊喜充分性等先进标准,覆盖率与鲁棒性之间的相关性依然微弱。
- 鲁棒性指标(如CLEVER分数)与对抗攻击成功率的相关性,强于与覆盖率指标的相关性。
- 覆盖率标准无法可靠预测使用对抗样本微调后的鲁棒性提升。
- 本研究为未来DNN测试方法的评估,提供了100个DNN模型、对抗样本及指标实现的公开基准。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。