[论文解读] Backdoor Attack and Defense for Deep Regression
本文提出了一种通过数据中毒实现的针对深度回归模型的定向后门攻击,其中对抗性样本在输入空间中被局部化以逃避检测。此外,本文引入了一种基于梯度的局部误差最大化器防御方法,用于识别并移除中毒样本,使攻击误差降低50%,同时在金融衍生品定价任务中保持较高的测试准确率。
We demonstrate a backdoor attack on a deep neural network used for regression. The backdoor attack is localized based on training-set data poisoning wherein the mislabeled samples are surrounded by correctly labeled ones. We demonstrate how such localization is necessary for attack success. We also study the performance of a backdoor defense using gradient-based discovery of local error maximizers. Local error maximizers which are associated with significant (interpolation) error, and are proximal to many training samples, are suspicious. This method is also used to accurately train for deep regression in the first place by active (deep) learning leveraging an "oracle" capable of providing real-valued supervision (a regression target) for samples. Such oracles, including traditional numerical solvers of PDEs or SDEs using finite difference or Monte Carlo approximations, are far more computationally costly compared to deep regression.
研究动机与目标
- 展示通过在训练集中进行有针对性的数据中毒,在深度回归模型上实现新型后门攻击。
- 证明将中毒样本定位在合法数据附近的区域对于攻击成功至关重要。
- 开发一种基于梯度的局部误差最大化器的防御机制,以检测并缓解后门攻击。
- 在使用昂贵的Oracle训练的深度神经网络上,基于真实世界的金融衍生品定价任务评估该方法。
- 证明移除可疑的局部误差最大化器可显著降低攻击性能,同时不损害正常推理的准确性。
提出的方法
- 攻击在输入空间的特定区域内注入带有特定触发模式的误标训练样本,该区域由到期时间、波动率和利率的约束定义。
- 防御方法使用梯度上升法识别深度神经网络与Oracle之间误差的局部最大值,重点关注插值误差较高的区域。
- 若局部误差最大化器具有异常高的误差且与大量训练样本接近(欧几里得距离 < 0.1),则被标记为可疑。
- 该方法利用主动学习原理,在移除可疑样本后,使用Oracle对模型进行再训练。
- 再训练使用加权均方误差目标函数,对干净数据赋予较高权重(α = 0.99),对检测到的对抗性样本赋予较低权重。
- 通过使用密度模型(如高斯混合模型)替代训练样本邻近度,可进一步增强防御方法,从而消除邻近度超参数。
实验结果
研究问题
- RQ1能否通过在训练集中进行局部化数据中毒,在深度回归模型中成功植入后门?
- RQ2为何对中毒样本的局部化在攻击成功中至关重要?
- RQ3基于梯度的局部误差最大化器能否可靠检测深度回归模型中的后门触发?
- RQ4移除位于可疑局部误差最大化器附近的样本是否能有效缓解后门性能,同时不降低正常模型准确率?
- RQ5在真实世界的金融衍生品定价场景下,该防御方法与基线模型相比表现如何?
主要发现
- 在防御再训练后,攻击的均方误差(MSE)相比原始中毒模型降低了50%。
- 该防御在保持或略微提升干净数据上的测试MSE和测试MAE的同时,使攻击MSE降低了约50%。
- 后门区域内的六个局部误差最大化器各自与超过1,000个邻近训练样本相连,其误差位于第98.5百分位数,邻近距离位于第99.9百分位数。
- 邻近训练样本的误报率极低(0.012%),表明对中毒区域的识别具有高度特异性。
- 该防御成功从后门区域中移除了1,823个误标样本,同时保持了干净数据上的模型性能。
- 即使使用密度模型替代原始训练样本邻近度,该方法仍保持有效,降低了对超参数的依赖。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。