[论文解读] Certified Neural Network Watermarks with Randomized Smoothing
该论文提出了一种基于随机平滑的首个可认证神经网络水印方法,可保证在模型参数未超过认证ℓ₂阈值时水印持久存在。该方法在对抗性移除攻击下提供可证明的鲁棒性,同时在经验上表现出优于先前方法的抗性。
Watermarking is a commonly used strategy to protect creators' rights to digital images, videos and audio. Recently, watermarking methods have been extended to deep learning models -- in principle, the watermark should be preserved when an adversary tries to copy the model. However, in practice, watermarks can often be removed by an intelligent adversary. Several papers have proposed watermarking methods that claim to be empirically resistant to different types of removal attacks, but these new techniques often fail in the face of new or better-tuned adversaries. In this paper, we propose a certifiable watermarking method. Using the randomized smoothing technique proposed in Chiang et al., we show that our watermark is guaranteed to be unremovable unless the model parameters are changed by more than a certain l2 threshold. In addition to being certifiable, our watermark is also empirically more robust compared to previous watermarking methods. Our experiments can be reproduced with code at https://github.com/arpitbansal297/Certified_Watermarks
研究动机与目标
- 为应对日益增长的对昂贵深度学习模型被盗用和未经授权复制的可证明保护需求。
- 克服现有水印方法在面对复杂对抗性移除技术时经验上易受攻击的局限性。
- 开发一种兼具理论认证和强经验抗攻击能力的水印方案。
- 评估基于ℓ₂的威胁模型在现实世界模型水印中的意义和实用性。
提出的方法
- 该方法利用随机平滑来认证嵌入在神经网络中的水印的鲁棒性。
- 通过向模型查询触发集来执行水印检测,其中水印被编码为一种能引发一致误分类的模式。
- 认证基于原始模型参数与扰动后模型参数之间的ℓ₂距离,确保任何超出该阈值的更改都会破坏水印。
- 水印通过一种改进的损失函数进行训练,该函数结合了标准训练和基于随机平滑的鲁棒性目标。
- 该方法支持白盒和黑盒水印验证,使其适用于现实世界中的基于API的部署场景。
- 该方法设计为与标准深度学习框架兼容,并可通过开源代码实现可复现性。
实验结果
研究问题
- RQ1能否正式认证神经网络水印,使其在模型参数未超过特定ℓ₂阈值时不会被移除?
- RQ2在实践中,认证半径的意义有多大,是否能为现实中的对抗性攻击提供充分保护?
- RQ3所提出的可认证水印方法是否在抵抗已知的移除攻击方面优于现有的经验性水印技术?
- RQ4是否仅通过API访问(黑盒环境)即可验证水印,还是必须依赖白盒访问?
- RQ5水印鲁棒性与在标准基准测试上的模型准确率之间存在何种权衡?
主要发现
- 所提出的水印具有可证明的鲁棒性:除非模型参数改变超过认证的ℓ₂距离,否则水印始终保持完整。
- 在CIFAR-10上,经过50轮微调后水印依然可见,而基线方法在10轮内即被完全移除。
- 在蒸馏攻击下,白盒水印在50轮后仍保持100%的触发集准确率,显著优于基线方法。
- 在黑盒环境下,经过50轮蒸馏后,水印在CIFAR-10上达到81.25%的触发集准确率,而基线仅为50.00%。
- 即使在无需认证证书的情况下,该方法在多个数据集和攻击类型中仍表现出一致的经验优越性。
- 尽管鲁棒性有所提升,但干净准确率有小幅下降:MNIST上为-0.1%,CIFAR-10上为-3.3%,CIFAR-100上为-1.1%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。