[论文解读] Exploring Adversarial Attack in Spiking Neural Networks with Spike-Compatible Gradient
该论文提出了一种新型基于梯度的脉冲神经网络(SNNs)对抗攻击框架,通过解决两个关键挑战:梯度-输入不兼容性与梯度消失问题。该方法引入了梯度到脉冲(G2S)转换器和受限脉冲翻转器(RSF),以生成有效的基于脉冲的对抗样本,在MNIST、CIFAR10和DVS数据集上实现了超过99%的攻击成功率,表明SNNs相较于人工神经网络(ANNs)具有更高的鲁棒性。
Recently, backpropagation through time inspired learning algorithms are widely introduced into SNNs to improve the performance, which brings the possibility to attack the models accurately given Spatio-temporal gradient maps. We propose two approaches to address the challenges of gradient input incompatibility and gradient vanishing. Specifically, we design a gradient to spike converter to convert continuous gradients to ternary ones compatible with spike inputs. Then, we design a gradient trigger to construct ternary gradients that can randomly flip the spike inputs with a controllable turnover rate, when meeting all zero gradients. Putting these methods together, we build an adversarial attack methodology for SNNs trained by supervised algorithms. Moreover, we analyze the influence of the training loss function and the firing threshold of the penultimate layer, which indicates a "trap" region under the cross-entropy loss that can be escaped by threshold tuning. Extensive experiments are conducted to validate the effectiveness of our solution. Besides the quantitative analysis of the influence factors, we evidence that SNNs are more robust against adversarial attack than ANNs. This work can help reveal what happens in SNN attack and might stimulate more research on the security of SNN models and neuromorphic devices.
研究动机与目标
- 解决尽管SNNs在神经形态硬件中日益广泛应用,但其对抗攻击研究仍缺乏系统性的现状。
- 克服在生成对抗样本过程中,SNNs中连续梯度与二进制脉冲输入之间不兼容的挑战。
- 缓解由脉冲神经元发放函数的零主导导数引起的梯度消失问题。
- 开发一种白盒攻击方法论,适用于基于图像和动态脉冲数据的SNN,基于BPTT训练的SNN。
- 研究训练损失函数与发放阈值对攻击效果的影响,识别出在交叉熵损失下存在的“陷阱”区域。
提出的方法
- 设计一种梯度到脉冲(G2S)转换器,通过概率采样、符号提取和溢出感知转换,将连续梯度转换为与二进制脉冲输入兼容的三值表示。
- 引入一种受限脉冲翻转器(RSF),在输入梯度为零时,通过元素选择和受控翻转率生成三值梯度,以翻转脉冲输入。
- 将G2S与RSF集成到统一的对抗攻击流水线中,兼容标准基于优化的攻击方法(如CWL2和BIM)。
- 通过集成G2S与RSF模块,将CWL2攻击适配至SNN,实现在尊重脉冲输入约束条件下的梯度累积。
- 采用时间反向传播(BPTT)启发的学习方法,提取对精确攻击引导至关重要的时空梯度。
- 通过调节倒数第二层的发放阈值,使模型能够逃离在交叉熵损失下导致攻击成功率下降的“陷阱”区域。
实验结果
研究问题
- RQ1如何将SNNs的连续梯度有效转换为与脉冲兼容的三值表示,以支持对抗样本的生成?
- RQ2何种机制可缓解在对抗训练期间,由脉冲发放函数的阶跃式特性导致的SNN梯度消失问题?
- RQ3训练损失函数的选择(如交叉熵与MSE)在多大程度上影响SNN对抗攻击的成功率?
- RQ4是否可通过调节倒数第二层的发放阈值,使模型逃离降低攻击有效性的“陷阱”区域?
- RQ5在基于梯度的对抗攻击下,SNNs与ANNs相比其鲁棒性如何,特别是在动态脉冲数据集上?
主要发现
- 所提出的G2S与RSF方法在MNIST和CIFAR10数据集上实现了超过99%的攻击成功率,创下SNN对抗攻击报告中的最高性能。
- 在动态手势-DVS(Gesture-DVS)数据集上,该攻击保持了高成功率且扰动水平可接受,证明其在静态图像数据之外的泛化能力。
- 在使用交叉熵损失训练的SNN中存在一个“陷阱”区域,攻击成功率显著下降,但通过调节倒数第二层的发放阈值可成功逃离该区域。
- 当CWL2攻击中的正则化参数$c$设置过高(如$c = 0.5$)时,攻击成功率下降,MNIST上的定向攻击成功率最高下降达32.45%。
- SNNs在对抗攻击中表现出比ANNs更高的鲁棒性,这从该攻击框架在多样化数据集和配置下的稳定表现中得到验证。
- 该方法对基于图像和基于脉冲的输入均有效,展现出对不同数据格式和神经形态数据表示的适应能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。