Skip to main content
QUICK REVIEW

[论文解读] Piracy-Resistant DNN Watermarking by Block-Wise Image Transformation with Secret Key

AprilPyone MaungMaung, Hitoshi Kiya|arXiv (Cornell University)|Apr 9, 2021
Advanced Steganography and Watermarking Techniques被引用 5
一句话总结

本文提出了一种抗盗版的DNN水印方法,通过使用密钥控制的可学习分块图像变换嵌入水印,实现无需预定义触发集的远程所有权验证。该方法在保持高模型准确率的同时,能有效抵抗微调和剪枝攻击,且水印检测强度始终高于任何盗版水印,因为篡改会导致性能下降。

ABSTRACT

In this paper, we propose a novel DNN watermarking method that utilizes a learnable image transformation method with a secret key. The proposed method embeds a watermark pattern in a model by using learnable transformed images and allows us to remotely verify the ownership of the model. As a result, it is piracy-resistant, so the original watermark cannot be overwritten by a pirated watermark, and adding a new watermark decreases the model accuracy unlike most of the existing DNN watermarking methods. In addition, it does not require a special pre-defined training set or trigger set. We empirically evaluated the proposed method on the CIFAR-10 dataset. The results show that it was resilient against fine-tuning and pruning attacks while maintaining a high watermark-detection accuracy.

研究动机与目标

  • 解决现有DNN水印方法在面对微调和模型剪枝等盗版攻击时鲁棒性不足的问题。
  • 实现在无需访问模型权重或预定义触发集的情况下,远程、黑盒的所有权验证。
  • 确保水印检测强度始终高于任何盗版水印,通过使篡改行为导致模型性能下降来实现。
  • 开发一种可无缝集成到标准训练流程中的方法,且不牺牲模型准确率。

提出的方法

  • 在训练过程中对输入图像应用可学习的、依赖于密钥的分块图像变换,生成编码水印的变换图像。
  • 使用原始(未变换)图像及其变换后的对应图像联合训练DNN,将水印嵌入模型的决策边界。
  • 通过比较模型对原始图像和其变换版本的预测结果,基于预测一致性计算检测得分,实现所有权验证。
  • 使用密钥控制变换函数,确保仅授权方能生成有效的变换图像用于验证。
  • 变换过程可微且支持端到端训练,使水印可在标准反向传播过程中嵌入。
  • 该方法无需额外正则化项或特殊触发集,与以往白盒或基于触发的方案形成鲜明区别。

实验结果

研究问题

  • RQ1能否设计一种DNN水印方法,在不降低模型准确率的前提下,有效抵抗微调和剪枝等盗版攻击?
  • RQ2是否可能在不依赖预定义触发集或模型权重访问的情况下,实现远程、黑盒的所有权验证?
  • RQ3能否使水印本身对覆盖攻击具有内在抵抗力,即任何试图插入新水印的行为都会导致模型性能下降?
  • RQ4所提出方法在各种攻击下,能否在保持高分类准确率的同时确保强水印检测能力?

主要发现

  • 在CIFAR-10数据集上,M=2时分类准确率达到92.74%,M=4时达到92.99%,与基线准确率95.45%相比性能损失极小。
  • 在正常条件下,水印检测准确率(WDA)分别达到95.87%(M=2)和94.20%(M=4),表明水印具有极强的可检测性。
  • 在使用100、500或5000张图像进行微调攻击时,原始水印检测准确率(τ)显著高于新密钥生成的水印检测准确率(τ′),例如M=2且使用100张图像时,τ=93.64% vs. τ′=13.26%。
  • 该方法对剪枝攻击具有鲁棒性,可承受高达60%的剪枝率,超过此阈值后分类准确率和WDA才开始下降。
  • 水印具有抗盗版能力,因为任何使用新密钥重新训练模型的行为都会导致性能下降,从而使原始水印比任何新水印更易检测。
  • 与最先进方法相比,所提方法在黑盒环境下展现出更优的抗盗版性能,尤其在ResNet18等深层架构上表现更佳。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。