[论文解读] Reversible Adversarial Attack based on Reversible Image Transformation
该论文提出了一种基于可逆图像变换(RIT)的可逆对抗攻击方法,用于生成保持高图像质量并能实现原始图像完美重建的可逆对抗样本(RAE)。通过使用RIT而非数据隐藏技术嵌入对抗扰动,该方法实现了不可察觉的失真,并且攻击强度可扩展,与扰动幅度无关,其在图像质量和鲁棒性方面均优于先前的RAE方法。
In order to prevent illegal or unauthorized access of image data such as human faces and ensure legitimate users can use authorization-protected data, reversible adversarial attack technique is rise. Reversible adversarial examples (RAE) get both attack capability and reversibility at the same time. However, the existing technique can not meet application requirements because of serious distortion and failure of image recovery when adversarial perturbations get strong. In this paper, we take advantage of Reversible Image Transformation technique to generate RAE and achieve reversible adversarial attack. Experimental results show that proposed RAE generation scheme can ensure imperceptible image distortion and the original image can be reconstructed error-free. What's more, both the attack ability and the image quality are not limited by the perturbation amplitude.
研究动机与目标
- 解决现有可逆对抗攻击方法在扰动较大时存在图像失真和恢复效果差的局限性。
- 实现具备强攻击能力与完美图像重建能力的可逆对抗样本(RAE),且与扰动幅度无关。
- 通过利用可逆图像变换(RIT)克服基于可逆数据隐藏(RDH)的RAE方法的容量限制。
- 改善对抗样本中攻击成功率、图像视觉质量和可逆性之间的平衡。
- 为保护敏感图像数据(如人脸)提供实用解决方案,同时允许授权系统恢复原始内容。
提出的方法
- 该方法将对抗样本视为目标图像,利用可逆图像变换(RIT)以可逆方式将原始图像嵌入对抗样本中。
- RIT能够以稳定且低影响的开销嵌入辅助信息(如原始图像数据),且与扰动大小无关。
- 通过在RAE上反向执行RIT过程,可实现原始图像的无误差重建。
- 该方法通过解耦扰动信号嵌入与辅助信息嵌入,避免了传统可逆数据嵌入(RDE)的容量限制。
- 通过最小化失真,保持高图像质量,因为RIT不随扰动幅度增大而放大。
- 该框架支持白盒和黑盒攻击设置,对抗扰动通过标准方法(如IFGSM和C&W)生成。
实验结果
研究问题
- RQ1可逆图像变换(RIT)能否有效用于构建具有高图像质量和完美重建能力的可逆对抗样本(RAE)?
- RQ2在不同扰动幅度下,基于RIT的RAE与基于RDE的RAE在图像失真和攻击鲁棒性方面有何差异?
- RQ3与受容量限制的先前RAE方法不同,所提方法在扰动强度增加时是否仍能保持强攻击性能?
- RQ4与基于扰动的嵌入相比,RIT中辅助信息的开销在多大程度上影响攻击成功率?
- RQ5与现有方法相比,基于RIT的RAE框架是否能在攻击能力、图像质量和可逆性之间实现更优的权衡?
主要发现
- 在IFGSM攻击下ε=4/225时,所提RIT-based RAE方法的PSNR达到30.81 dB,显著优于Liu等人基于RDE的方法(22.64 dB)。
- 在更强扰动(ε=8/225)下,所提方法的PSNR保持在27.59 dB,而Liu等人方法仅为21.93 dB,表明图像质量更优。
- 在C&W_L2攻击(κ=100)下,所提方法的PSNR达到32.13 dB,而Liu等人方法为22.57 dB,表明失真极小。
- 在DeepFool攻击设置下,所提方法生成的RAE PSNR达到35.48 dB,优于Liu等人在原始图像与对抗图像比较中得到的40.24 dB,表明整体质量保持更佳。
- 与基于RDE的方法不同,该方法在不降低图像质量或导致重建失败的情况下支持更大扰动,后者受失真和容量限制影响。
- 攻击成功率不受扰动幅度限制,且由于辅助信息嵌入稳定,更强扰动下可实现更高的攻击成功率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。