QUICK REVIEW
[论文解读] Reversible Adversarial Examples.
Jiayang Liu, Dongdong Hou|arXiv (Cornell University)|Nov 1, 2018
Adversarial Robustness in Machine Learning参考文献 30被引用 7
一句话总结
本文提出了一种新颖的方法,通过可逆数据隐藏生成可逆对抗性样本,使深度神经网络产生误分类,同时在无失真情况下完美恢复原始图像。该方法以可逆方式嵌入对抗性扰动,确保解码后图像保真度不受影响。
ABSTRACT
Deep Neural Networks have recently led to significant improvement in many fields such as image classification and speech recognition. However, these machine learning models are vulnerable to adversarial examples which can mislead machine learning classifiers to give incorrect classifications. In this paper, we take advantage of reversible data hiding to construct reversible adversarial examples which are still misclassified by Deep Neural Networks. Furthermore, the proposed method can recover original images from reversible adversarial examples with no distortion.
研究动机与目标
- 为解决深度神经网络对对抗性样本的脆弱性,提出一种可逆机制。
- 实现对抗性样本的生成,且不会永久改变原始图像。
- 确保在移除对抗性扰动后,原始输入图像可被完美重建。
- 在保持图像完整性的同时,维持高误分类率。
提出的方法
- 利用可逆数据隐藏技术,以可精确重建的方式将对抗性扰动嵌入图像。
- 采用可逆嵌入框架,将对抗性噪声编码在最低有效位或类似的可逆结构中。
- 对修改后的图像应用深度神经网络分类器,诱导误分类,同时保持可逆性。
- 采用解码过程提取对抗性扰动并以零失真恢复原始图像。
- 确保对抗性样本在欺骗分类器方面保持有效性,同时实现源图像的无损恢复。
实验结果
研究问题
- RQ1是否可以构建一种可逆对抗性样本,从而实现原始图像的完美恢复?
- RQ2可逆数据隐藏是否能在不损害图像保真度的前提下实现有效的对抗性攻击?
- RQ3深度神经网络能否被可逆修改的对抗性样本所欺骗?
- RQ4在此框架中,攻击成功率与可逆性之间的权衡关系如何?
主要发现
- 所提出的方法成功生成了能以高攻击成功率误导深度神经网络的对抗性样本。
- 从对抗性样本中恢复原始图像时无任何失真,证实了完美的可逆性。
- 该方法保持了样本的对抗性特征,确保其被目标模型错误分类。
- 该方法表明,可逆数据隐藏可有效集成到对抗性样本生成过程中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。