Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Invert: Simple Adaptive Attacks for Gradient Inversion in Federated Learning

Ruihan Wu, Xiangyu Chen|arXiv (Cornell University)|Oct 19, 2022
Privacy-Preserving Technologies in Data被引用数 7
ひとこと要約

この論文では、フェデレーテッドラーニングにおけるクライアントデータを勾配から再構成するための学習ベースの勾配逆引き攻撃であるLearning to Invert (LTI) を提案する。最適化ベースの攻撃とは異なり、LTI は防御をデータ拡張として扱うことで、防御に適応し得る。視覚および自然言語処理のタスクにおいて、差分プライバシー、勾配プルーニング、符号圧縮などの防御に対しても、最先端の性能を達成する。

ABSTRACT

Gradient inversion attack enables recovery of training samples from model gradients in federated learning (FL), and constitutes a serious threat to data privacy. To mitigate this vulnerability, prior work proposed both principled defenses based on differential privacy, as well as heuristic defenses based on gradient compression as countermeasures. These defenses have so far been very effective, in particular those based on gradient compression that allow the model to maintain high accuracy while greatly reducing the effectiveness of attacks. In this work, we argue that such findings underestimate the privacy risk in FL. As a counterexample, we show that existing defenses can be broken by a simple adaptive attack, where a model trained on auxiliary data is able to invert gradients on both vision and language tasks.

研究の動機と目的

  • フェデレーテッドラーニングにおける勾配逆引き攻撃に対する既存の防御が、最適化ベースの攻撃評価に依存しているため、それらが不十分であることを示すこと。
  • 異なる防御メカニズムに一般化可能な、適応的で学習ベースの攻撃に対する評価のギャップを埋めること。
  • 視覚および言語タスクに一般化可能な、シンプルだが効果的な学習ベースの攻撃フレームワークを提案すること。このフレームワークは、さまざまな勾配圧縮および摂動防御下でも有効である。
  • 差分プライバシーおよび勾配圧縮などの強力な防御が適用されても、学習された逆引きモデルを用いることで、データ再構成が依然として可能であることを示すこと。
  • LTI をフェデレーテッドラーニングシステムにおけるプライバシー漏洩の新たなベースラインとして提唱すること。

提案手法

  • プライベートデータと類似した分布を持つ補助データセットを用いて、勾配から入力データを再構成するための逆引きモデル $g_{\theta}$ を学習する。
  • 補助データに対してグローバルモデルを用いて勾配を計算することで、逆引きモデルのエンドツーエンド学習を可能にする。
  • 勾配圧縮または摂動防御を訓練中にデータ拡張として扱い、逆引きモデルが変更された勾配空間に適応できるようにする。
  • 反復的最適化を必要とせず、実際のフェデレーテッドラーニング環境におけるリアルな勾配からクライアント入力を回復するために、訓練済みの逆引きモデルを適用する。
  • 言語モデルの事前知識を用いたトークンレベルの再構成により、離散的データ(例:テキスト)に対してもこの手法を拡張する。
  • 精度やFIDなどの指標を用いて、TAG や Zhu et al. (2019) などの最適化ベースのベースラインと比較して性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1標準的な防御下で、フェデレーテッドラーニングにおける既存の最適化ベースの勾配逆引き攻撃を上回る学習ベースのアプローチが可能かどうか。
  • RQ2差分プライバシー、勾配プルーニング、符号圧縮などの防御が適用された場合、提案されたLTI攻撃の有効性はいかほどか。
  • RQ3疑似文(ランダムな語の抽出による)などの分布外の補助データで学習した場合、逆引きモデルの一般化能力はどの程度達成できるか。
  • RQ4視覚および言語タスクの両方において、さまざまな防御機構下でLTIの性能は向上するか、あるいは低下するか。
  • RQ5さまざまな勾配圧縮方式下でも、高い再構成品質を維持しつつ、LTI をテキストなどの離散的データに適応可能かどうか。

主な発見

  • CIFAR-10 と ResNet20 を用いた実験では、防御が適用されていない状況下で、LTI は最適化ベースの手法(例:Zhu et al., 2019)と同等の回復精度を達成する。
  • 勾配プルーニングおよび符号圧縮防御下では、LTI は先行研究の攻撃を顕著に上回り、符号圧縮下でCIFAR-10 と ResNet20 を用いた際の精度が 87.34% に達する。
  • CoLA テキスト分類タスクでは、符号圧縮下で LTI が 86.19% の精度を達成し、すべての防御設定で TAG や他のベースラインを上回る。
  • 分布外の補助データ(ランダム語の抽出)を用いた LTI-OOD は、WikiText で 87.39% の精度を達成し、一部の設定で LTI を上回る結果となり、優れた一般化能力を示している。
  • 防御が適用されても攻撃が依然として有効であることが示され、勾配圧縮および摂動はプライバシー漏洩を完全に緩和しないことが明らかになった。
  • LTI はさまざまなモデルアーキテクチャおよびタスクにおいてロバストであり、視覚および言語タスクの両方で最適化ベースの手法に比べて一貫して優れた性能を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。