Skip to main content
QUICK REVIEW

[論文レビュー] Certified Neural Network Watermarks with Randomized Smoothing

Arpit Bansal, Ping-yeh Chiang|arXiv (Cornell University)|Jul 16, 2022
Adversarial Robustness in Machine Learning被引用数 11
ひとこと要約

本稿では、ランダム化スムージングを用いた、最初の証明可能(certifiable)なニューラルネットワークウォーターマーキング手法を提案する。この手法は、モデルパラメータが特定の certified ℓ₂しきい値を超えて変更されない限り、ウォーターマーキングの持続性を保証する。アドバーシャル除去攻撃に対して証明可能な耐性を提供するとともに、先行手法と比較して優れた実験的耐性を示している。

ABSTRACT

Watermarking is a commonly used strategy to protect creators' rights to digital images, videos and audio. Recently, watermarking methods have been extended to deep learning models -- in principle, the watermark should be preserved when an adversary tries to copy the model. However, in practice, watermarks can often be removed by an intelligent adversary. Several papers have proposed watermarking methods that claim to be empirically resistant to different types of removal attacks, but these new techniques often fail in the face of new or better-tuned adversaries. In this paper, we propose a certifiable watermarking method. Using the randomized smoothing technique proposed in Chiang et al., we show that our watermark is guaranteed to be unremovable unless the model parameters are changed by more than a certain l2 threshold. In addition to being certifiable, our watermark is also empirically more robust compared to previous watermarking methods. Our experiments can be reproduced with code at https://github.com/arpitbansal297/Certified_Watermarks

研究の動機と目的

  • 高価なディープラーニングモデルの盗難や不正な複製に対する、証明可能な保護の必要性が高まる中で、これを解決すること。
  • 洗練されたアドバーシャル除去技術に対して実験的に脆弱である既存のウォーターマーキング手法の限界を克服すること。
  • 理論的証明と強力な実験的耐性の両方を備えたウォーターマーキング方式を開発すること。
  • ℓ₂ベースの脅威モデルが、現実世界のモデルウォーターマーキングにおいて意味的で実用的であるかどうかを評価すること。

提案手法

  • 本手法は、ランダム化スムージングを活用し、ニューラルネットワークに埋め込まれたウォーターマーキングの耐性を証明する。
  • ウォーターマーキングの検出は、トリガセットをモデルに問い合わせることで実施され、ウォーターマーキングは一貫した誤分類を引き起こすパターンとして符号化される。
  • 証明は、元のモデルパラメータと摂動を加えたモデルパラメータ間のℓ₂距離に基づく。これにより、このしきい値を超えて変更されればウォーターマーキングが破壊されることを保証する。
  • ウォーターマーキングは、標準的なトレーニングとランダム化スムージングに基づく耐性目的関数を組み合わせた修正損失関数を用いて学習される。
  • ホワイトボックスおよびブラックボックスの両方のウォーターマーキング検証をサポートしており、実際のAPIベースの展開環境でも利用可能である。
  • 本手法は標準的なディープラーニングフレームワークと互換性があり、オープンソースコードを介して再現可能である。

実験結果

リサーチクエスチョン

  • RQ1モデルパラメータが特定のℓ₂しきい値を超えて変更されない限り、ニューラルネットワークウォーターマーキングが除去されないことを形式的に証明できるか?
  • RQ2実際の状況において、証明可能な半径はどれほど意味的であり、現実のアドバーシャル攻撃に対して十分な保護を提供するか?
  • RQ3提案された証明可能なウォーターマーキング手法は、既存の実験的ウォーターマーキング技術に比べ、既知の除去攻撃に対して優れた耐性を示すか?
  • RQ4APIアクセスのみ(ブラックボックス設定)でウォーターマーキングを検証できるか、それともホワイトボックスアクセスが必要か?
  • RQ5標準ベンチマーク上でのウォーターマーキングの耐性とモデル精度のトレードオフはどのようになるか?

主な発見

  • 提案手法のウォーターマーキングは、形式的に耐性がある:モデルパラメータが認証されたℓ₂距離を超えて変更されない限り、維持される。
  • CIFAR-10では、ファインチューニング50エポック後もウォーターマーキングが可視であり、ベースラインは10エポック未満で完全に消去される。
  • 蒸留攻撃において、ホワイトボックスでのウォーターマーキングは50エポック後も100%のトリガセット精度を維持し、ベースラインを著しく上回る。
  • ブラックボックス設定では、CIFAR-10で50エポックの蒸留後、ウォーターマーキングのトリガセット精度は81.25%に達するが、ベースラインは50.00%にとどまる。
  • 証明が不要な状況でも、複数のデータセットおよび攻撃タイプにおいて一貫した実験的優位性を示している。
  • 耐性の向上にもかかわらず、わずかなクリーン精度の低下が生じる:MNISTでは-0.1%、CIFAR-10では-3.3%、CIFAR-100では-1.1%。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。