Skip to main content
QUICK REVIEW

[论文解读] False Claims against Model Ownership Resolution

Jian Liu, Rui Zhang|arXiv (Cornell University)|Apr 13, 2023
Adversarial Robustness in Machine Learning被引用 4
一句话总结

本文揭示了现有模型所有权解析(MOR)方案中的一个关键漏洞:恶意举报人可通过构造可迁移的对抗性样本作为‘证据’,虚假声称拥有独立训练的模型。作者将常见的MOR流程泛化,并证明防止此类虚假主张等价于阻止可迁移的对抗性样本,从而证明所有被调研的MOR方案——包括亚马逊的Rekognition API——在现实条件下均易受此类攻击影响。

ABSTRACT

Deep neural network (DNN) models are valuable intellectual property of model owners, constituting a competitive advantage. Therefore, it is crucial to develop techniques to protect against model theft. Model ownership resolution (MOR) is a class of techniques that can deter model theft. A MOR scheme enables an accuser to assert an ownership claim for a suspect model by presenting evidence, such as a watermark or fingerprint, to show that the suspect model was stolen or derived from a source model owned by the accuser. Most of the existing MOR schemes prioritize robustness against malicious suspects, ensuring that the accuser will win if the suspect model is indeed a stolen model. In this paper, we show that common MOR schemes in the literature are vulnerable to a different, equally important but insufficiently explored, robustness concern: a malicious accuser. We show how malicious accusers can successfully make false claims against independent suspect models that were not stolen. Our core idea is that a malicious accuser can deviate (without detection) from the specified MOR process by finding (transferable) adversarial examples that successfully serve as evidence against independent suspect models. To this end, we first generalize the procedures of common MOR schemes and show that, under this generalization, defending against false claims is as challenging as preventing (transferable) adversarial examples. Via systematic empirical evaluation, we show that our false claim attacks always succeed in the MOR schemes that follow our generalization, including in a real-world model: Amazon's Rekognition API.

研究动机与目标

  • 识别并分析模型所有权解析(MOR)方案中此前被忽视的鲁棒性威胁:恶意举报人发起的虚假主张。
  • 证明可通过利用可迁移的对抗性样本系统性构造虚假主张,从而欺骗验证流程。
  • 表明所有主流MOR方案,包括现实世界部署如亚马逊Rekognition,均在现实配置下易受此类攻击。
  • 建立一个通用的MOR流程框架,表明除非阻止可迁移的对抗性样本,否则虚假主张将不可避免。
  • 提供针对此类新型攻击的加固建议,同时承认潜在对策可能带来高昂的性能与部署成本。

提出的方法

  • 将常见的MOR方案泛化为统一框架,其中举报人提供触发集,裁判通过在可疑模型上进行推理来验证所有权。
  • 构建恶意举报人的威胁模型,其偏离协议,通过构造对抗性样本使其在独立模型上表现如有效触发。
  • 利用对抗性样本的可迁移性,生成可使任何独立模型(无论来源如何)均产生高激活的触发集。
  • 在16种MOR方案上进行实证评估,包括水印与指纹技术,使用CIFAR-10、ImageNet及亚马逊Rekognition API。
  • 证明该攻击在所有测试配置下均100%有效,即使模型为独立训练且未访问源模型。
  • 提出通用对策,如对抗性防御机制或输入净化,尽管需注意其可能带来的性能与部署成本。

实验结果

研究问题

  • RQ1恶意举报人能否成功对未源自其源模型的独立训练模型提出虚假所有权主张?
  • RQ2现有MOR方案的设计是否固有地存在对虚假主张的脆弱性,特别是那些依赖触发集进行验证的方案?
  • RQ3对抗性样本的可迁移性在多大程度上使虚假主张在多种MOR方案及真实世界模型中成为可能?
  • RQ4在不阻止可迁移对抗性样本的前提下,能否保证MOR方案对虚假主张的鲁棒性?
  • RQ5该漏洞对法律及现实世界中模型所有权解析系统的部署具有何种实际影响?

主要发现

  • 所有被调研的MOR方案,包括基于水印、指纹和学习证明的方案,均易受恶意举报人虚假主张的影响。
  • 该虚假主张攻击在所有现实配置下均100%有效,包括在亚马逊Rekognition API上。
  • 该攻击有效,是因为可迁移的对抗性样本可被构造为模仿有效触发,导致独立模型表现得如同源自举报人的源模型。
  • 该脆弱性源于MOR方案的通用结构:验证依赖于在触发集上对模型进行推理,使其易受对抗性操纵。
  • 核心洞见是:防御虚假主张的难度等同于阻止可迁移对抗性样本,而这是鲁棒机器学习领域长期存在的开放问题。
  • 尽管存在通用对策,但其常伴随显著的计算或部署成本,导致该问题在实践中仍无法解决。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。