Skip to main content
QUICK REVIEW

[論文レビュー] False Claims against Model Ownership Resolution

Jian Liu, Rui Zhang|arXiv (Cornell University)|Apr 13, 2023
Adversarial Robustness in Machine Learning被引用数 4
ひとこと要約

この論文は、既存のモデル所有権解消(MOR)方式における深刻な脆弱性を明らかにしている:悪意ある主張者(accuser)は、移譲可能な敵対的例(transferable adversarial examples)を「証拠」として使用することで、独立に訓練されたモデルの所有権を誤って主張できる。著者らは一般的なMOR手順を一般化し、このような誤った主張を防ぐことは移譲可能な敵対的例の防止に等しいことを証明しており、調査されたすべてのMOR方式——包括的にAmazonのRekognition APIでさえも——現実的な条件下で脆弱であることを示している。

ABSTRACT

Deep neural network (DNN) models are valuable intellectual property of model owners, constituting a competitive advantage. Therefore, it is crucial to develop techniques to protect against model theft. Model ownership resolution (MOR) is a class of techniques that can deter model theft. A MOR scheme enables an accuser to assert an ownership claim for a suspect model by presenting evidence, such as a watermark or fingerprint, to show that the suspect model was stolen or derived from a source model owned by the accuser. Most of the existing MOR schemes prioritize robustness against malicious suspects, ensuring that the accuser will win if the suspect model is indeed a stolen model. In this paper, we show that common MOR schemes in the literature are vulnerable to a different, equally important but insufficiently explored, robustness concern: a malicious accuser. We show how malicious accusers can successfully make false claims against independent suspect models that were not stolen. Our core idea is that a malicious accuser can deviate (without detection) from the specified MOR process by finding (transferable) adversarial examples that successfully serve as evidence against independent suspect models. To this end, we first generalize the procedures of common MOR schemes and show that, under this generalization, defending against false claims is as challenging as preventing (transferable) adversarial examples. Via systematic empirical evaluation, we show that our false claim attacks always succeed in the MOR schemes that follow our generalization, including in a real-world model: Amazon's Rekognition API.

研究の動機と目的

  • モデル所有権解消(MOR)方式におけるこれまで見過ごされていた耐性の脅威、すなわち悪意ある主張者が元のモデルとは関係のない独立に訓練されたモデルに対して誤った所有権主張を行う可能性を特定・分析すること。
  • 移譲可能な敵対的例を用いて、検証プロセスをだますことのできる、体系的な誤った主張の構築を示すこと。
  • CIFAR-10、ImageNet、およびAmazon Rekognition APIを含む、実世界の展開例(例:Amazon Rekognition)を含む、主なMOR方式すべてが現実的な設定下でこの攻撃に対して脆弱であることを示すこと。
  • 誤った主張が避けられない状況を生じさせる、MOR手順の一般化された枠組みを確立すること。
  • この新たな攻撃クラスに対するMOR方式の強化ガイドラインを提供すること。ただし、対策の実装に伴う高いコストを認識していること。

提案手法

  • 主張者(accuser)がトリガー集合を提示し、裁判官(judge)が懸念されるモデルに対する推論によって所有権を検証するという、共通するMOR方式を統一的フレームワークに一般化する。
  • プロトコルから逸脱して、独立したモデルに対して有効なトリガーとして機能する敵対的例を生成する悪意ある主張者の脅威モデルを定式化する。
  • 敵対的例の移譲性(transferability)を活用し、元のモデルとは無関係に、任意の独立モデルに対して高い活性化を引き起こすトリガー集合を生成する。
  • CIFAR-10、ImageNet、およびAmazon Rekognition APIを用いて、16種類のMOR方式(水印技術やファングプリント技術を含む)に対して攻撃を実験的に評価する。
  • 攻撃が、モデルが独立に訓練され、元のモデルへのアクセスがなくても、すべてのテスト設定で100%の成功率を示すことを実証する。
  • 敵対的防御メカニズムや入力のクリーニング(sanitization)などの一般的な対策を提案するが、それらが計算コストや導入コストを伴う可能性があることを指摘する。

実験結果

リサーチクエスチョン

  • RQ1悪意ある主張者が、元のモデルとは関係のない独立に訓練されたモデルに対して、誤った所有権主張を成功させることができるか?
  • RQ2特にトリガー集合を検証に用いるMOR方式の設計に、誤った主張に対する脆弱性が本質的に内在しているか?
  • RQ3敵対的例の移譲性が、多様なMOR方式および実世界のモデルにわたり、誤った主張を可能にする程度はどの程度か?
  • RQ4移譲可能な敵対的例の防止をしない限り、MOR方式の誤った主張に対する耐性を保証することは可能か?
  • RQ5この脆弱性が、法的および実世界のモデル所有権解消システムの展開に及ぼす実用的影響は何か?

主な発見

  • 調査されたMOR方式、水印技術、ファングプリント技術、学習証明(proof-of-learning)を含む、すべてが悪意ある主張者による誤った主張に対して脆弱である。
  • AmazonのRekognition APIを含む、現実的設定すべてで攻撃が100%の効果を示した。
  • 攻撃が成功するのは、移譲可能な敵対的例が有効なトリガーを模倣できるためであり、これにより独立したモデルが、元の主張者のモデル由来であるかのように反応する。
  • 脆弱性は、検証がトリガー集合に対するモデル推論に依存するというMOR方式の一般的な構造に起因しており、敵対的干渉に弱い。
  • 核心的な洞察は、誤った主張に対する防御は、移譲可能な敵対的例の防止と同等の難易度であり、これは長年のオープンな課題である。
  • 一般的な対策は存在するが、しばしば顕著な計算コストや導入コストを伴い、実際には問題が解決されていない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。