[论文解读] Connecting the Dots: Detecting Adversarial Perturbations Using Context Inconsistency
本文提出SCEME,一种上下文感知的对抗性检测方法,用于目标检测,通过测量空间、物体-物体、物体-背景及物体-场景上下文中的不一致性来识别对抗性扰动。通过训练类别特定的自编码器以建模正常上下文分布,该方法可识别出重建误差较高的误分类区域,从而在PASCAL VOC和MS COCO上实现超过0.95的AUC,较最先进的无上下文感知方法高出20–35%。
There has been a recent surge in research on adversarial perturbations that defeat Deep Neural Networks (DNNs) in machine vision; most of these perturbation-based attacks target object classifiers. Inspired by the observation that humans are able to recognize objects that appear out of place in a scene or along with other unlikely objects, we augment the DNN with a system that learns context consistency rules during training and checks for the violations of the same during testing. Our approach builds a set of auto-encoders, one for each object class, appropriately trained so as to output a discrepancy between the input and output if an added adversarial perturbation violates context consistency rules. Experiments on PASCAL VOC and MS COCO show that our method effectively detects various adversarial attacks and achieves high ROC-AUC (over 0.95 in most cases); this corresponds to over 20% improvement over a state-of-the-art context-agnostic method.
研究动机与目标
- 解决深度神经网络对违反场景级上下文的对抗性扰动的脆弱性,这些扰动会导致物体被错误分类。
- 通过利用物体及其周围环境之间的上下文关系,而非仅依赖分类置信度,来提升对抗性检测性能。
- 开发一种对目标检测系统中的数字和物理对抗攻击均有效的防御机制。
- 证明上下文不一致性是检测对抗性样本的可靠信号,尤其当模型将物体误分类为在场景中不太可能共现的类别时。
- 通过将整体场景上下文整合到检测流程中,超越无上下文感知的检测方法。
提出的方法
- 该方法构建一个全连接图,包含所提出的物体区域以及一个代表整个场景的超区域节点。
- 每个节点被赋予一个上下文特征向量,由节点特征(区域特征)和边特征(区域之间的上下文关系)组成。
- 针对每个物体类别,训练一个独立的自编码器,以在干净数据上建模其上下文特征向量的分布,学习重建正常的上下文模式。
- 推理过程中,使用预测类别的自编码器来重建检测区域的上下文特征向量;若重建误差较高,则表明存在上下文不一致,系统将该样本标记为潜在对抗性样本。
- 系统评估四种上下文类型:空间(相同物体区域)、物体-物体(共现物体)、物体-背景(物体-场景对齐)和物体-场景(整体场景一致性)。
- 该方法应用于基于Faster R-CNN的检测器,并在PASCAL VOC和MS COCO上针对数字和物理对抗攻击进行了测试。
实验结果
研究问题
- RQ1上下文不一致性能否作为检测目标检测中对抗性扰动的可靠信号?
- RQ2空间、物体-物体、物体-背景和物体-场景等不同类型的上下文如何贡献于对抗性检测性能?
- RQ3将场景级上下文纳入检测是否能提升性能,超越无上下文感知的方法?
- RQ4该方法在检测物理对抗攻击(如添加贴纸导致的停车标志误分类)方面的有效性如何?
- RQ5所提区域数量和场景中物体密度在多大程度上影响检测性能?
主要发现
- SCEME在各种对抗性攻击下,于PASCAL VOC和MS COCO上的平均ROC-AUC均超过0.95,显著优于最先进的无上下文感知方法。
- 在停车标志检测任务中,SCEME在0.1%的假阳性率下检测到54%的扰动样本,而FeatureSqueeze的检测率为0%,表明SCEME具有更高的敏感性。
- 当假阳性率控制在0.1%时,该方法检测到的对抗性样本数量几乎是仅使用节点特征的消融版本的两倍。
- 检测性能随区域提议数量的增加而提升,表明空间上下文对识别对抗性不一致性具有显著贡献。
- 随着场景中物体密度的增加,性能也随之提升,表明物体-物体上下文在场景复杂度提高时更为有效。
- 该方法能有效检测“出现物体”类攻击,检测准确率随扰动物体与真实框之间的IoU增大而上升,证实了空间上下文的作用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。