Skip to main content
QUICK REVIEW

[論文レビュー] InstaHide: Instance-hiding Schemes for Private Distributed Learning

Yangsibo Huang, Zhao Song|arXiv (Cornell University)|Oct 6, 2020
Privacy-Preserving Technologies in Data参考文献 70被引用数 19
ひとこと要約

InstaHide は、プライベートな分散ディープラーニングのための軽量で効率的なインスタンス隠し方式であり、1回限りの秘密鍵を用いて、公開または非公開の画像とのランダムな混合とピixeL単位の符号反転によってトレーニング画像を暗号化する。モデルの精度を最小限に低下させながらも、既知の攻撃(モーメント解析や類似度クラスタリングに基づく攻撃など)に対して耐性を持ち、既存のフェデレーテッドラーニングパイプラインに簡単に統合可能で、強力なプライバシー保証を提供する。

ABSTRACT

How can multiple distributed entities collaboratively train a shared deep net on their private data while preserving privacy? This paper introduces InstaHide, a simple encryption of training images, which can be plugged into existing distributed deep learning pipelines. The encryption is efficient and applying it during training has minor effect on test accuracy. InstaHide encrypts each training image with a "one-time secret key" which consists of mixing a number of randomly chosen images and applying a random pixel-wise mask. Other contributions of this paper include: (a) Using a large public dataset (e.g. ImageNet) for mixing during its encryption, which improves security. (b) Experimental results to show effectiveness in preserving privacy against known attacks with only minor effects on accuracy. (c) Theoretical analysis showing that successfully attacking privacy requires attackers to solve a difficult computational problem. (d) Demonstrating that use of the pixel-wise mask is important for security, since Mixup alone is shown to be insecure to some some efficient attacks. (e) Release of a challenge dataset https://github.com/Hazelsuko07/InstaHide_Challenge Our code is available at https://github.com/Hazelsuko07/InstaHide

研究の動機と目的

  • ヒーラー(HIPAA)やGDPRなどのプライバシー規制に違反せずに、分散されたエントリティ間でプライベートデータを用いた共有ディープニューラルネットワークのトレーニングを実現すること。
  • 微分プライバシー や高コストな暗号技術に代わる実用的で効率的な代替手段を提供すること。これらは計算コストの高さや顕著な精度損失の問題を抱えている。
  • 微分プライバシーで保護されたモデル更新を観測しても、攻撃者が個々のトレーニング画像を特定できないような方式を開発すること。
  • トレーニングパイプラインへの最小限の変更で、既存のディープラーニングフレームワークに統合可能であること。
  • チャレンジデータセットの公開を通じて、さらなるプライバシー攻撃研究を促進すること。

提案手法

  • 各トレーニング画像を、ターゲット画像と、プライベートまたはパブリックデータセット(例:ImageNet)からランダムに選択された k−1 枚の画像とのランダムな線形結合から成る1回限りの秘密鍵で暗号化する。
  • 混合画像にランダムなピクセル単位の符号反転を適用し、元の画像を効果的に隠蔽しながらラベル情報は保持する。
  • 1枚の画像に対して秘密鍵を1回だけ使用するため、1回限りの使用が保証され、鍵の再利用攻撃を防ぐ。
  • 画像分類のための大規模なパブリックデータセット(例:ImageNet)の統計的性質を、暗号理論におけるランダムオракルに類似したランダム性の源として活用する。
  • トレーニング中に元の画像を暗号化されたバージョンに置き換えることで、フェデレーテッドラーニングパイプラインにスムーズに統合可能である。
  • 2段階の防御を採用する:パブリックデータとの混合による攻撃者による探索空間の拡大、およびモーメントベース攻撃からの回復を防ぐための符号反転。

実験結果

リサーチクエスチョン

  • RQ1最小限の精度損失で個々のトレーニング画像を隠蔽できる、軽量で効率的な画像暗号化方式を設計できるか?
  • RQ2InstaHide は、モーメントベースの回復攻撃や類似度クラスタリング攻撃といった既知の攻撃に対してどれほど効果的に耐性を示すか?
  • RQ3混合に使用する大規模なパブリックデータセット(例:ImageNet)とプライベートデータの両方を用いた場合、セキュリティと精度にどのような影響を与えるか?
  • RQ4Mixup とランダムな符号反転の組み合わせは、Mixup 単体よりも強力なプライバシー保護を提供できるか?
  • RQ5勾配のみが露出される現実のフェデレーテッドラーニング環境において、InstaHide はどのように性能を発揮するか?

主な発見

  • InstaHide を使用しても、CIFAR-10 や ImageNet において、k=6 でさえも精度低下が 2% 未満に抑えられる。
  • 実画像はガウス分布に従わない性質を持ち、k の増加により攻撃の難易度が上昇するため、Braverman のモーメントベース攻撃に対して耐性を示す。
  • Carlini らのクラスタリングベース攻撃は、100 枚のプライベート画像から成るチャレンジデータセットでは有効に機能するが、O(n³) の計算量のため、大規模なデータセットでは計算的に実行不可能である。
  • ImageNet などの大規模なパブリックデータセットを用いることで、攻撃者の探索空間が著しく拡大され、セキュリティが強化される。
  • ランダムな符号反転は、線形構造を効率的に利用する攻撃に対して脆弱な Mixup 単体よりも、セキュリティを確保するために不可欠である。
  • 著者が公開したチャレンジデータセットは、新たな暗号解析研究を促進し、既知の攻撃モデル下でも本方式の耐性の高さを実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。