Skip to main content
QUICK REVIEW

[論文レビュー] Fishing for User Data in Large-Batch Federated Learning via Gradient Magnification

Yuxin Wen, Jonas Geiping|arXiv (Cornell University)|Feb 1, 2022
Privacy-Preserving Technologies in Data被引用数 16
ひとこと要約

この論文は、大規模バッチでのフェデレーテッドラーニングにおけるプライバシー侵害を可能にする、モデルに依存しない勾配拡大攻撃を提案している。サーバーの更新を操作することで、個々のユーザーのデータポイントを分離・抽出可能となる。この手法はアーキテクチャの変更を一切必要とせず、ユーザーに送信されるモデルパラメータのみを変更する。256までのバッチサイズですでに高い忠実度のデータ再構築が達成されており、クロスデバイスおよびクロスシロ設定における重大なプライバシー脆弱性を示している。

ABSTRACT

Federated learning (FL) has rapidly risen in popularity due to its promise of privacy and efficiency. Previous works have exposed privacy vulnerabilities in the FL pipeline by recovering user data from gradient updates. However, existing attacks fail to address realistic settings because they either 1) require toy settings with very small batch sizes, or 2) require unrealistic and conspicuous architecture modifications. We introduce a new strategy that dramatically elevates existing attacks to operate on batches of arbitrarily large size, and without architectural modifications. Our model-agnostic strategy only requires modifications to the model parameters sent to the user, which is a realistic threat model in many scenarios. We demonstrate the strategy in challenging large-scale settings, obtaining high-fidelity data extraction in both cross-device and cross-silo federated learning.

研究の動機と目的

  • 大規模バッチサイズで失敗するか、現実的でないアーキテクチャ変更を必要とする既存のフェデレーテッドラーニングのプライバシー攻撃におけるギャップを埋めること。
  • 信頼できないサーバーの更新という脅威モデルを調査すること。ここでは、サーバーがユーザーに悪意のある設計されたモデルパラメータを送信する。
  • クライアントモデルのアーキテクチャやトレーニングプロセスを変更せずに、任意の大きなバッチから高忠実度のデータ抽出を可能にする実用的でモデルに依存しない攻撃を開発すること。
  • クロスデバイスおよびクロスシロ設定の両方で、攻撃の実現可能性と有効性を実証すること。
  • プライバシー攻撃の不均等な影響を強調し、外れ値や代表されていないデータポイントがより脆弱であることを示すこと。

提案手法

  • 攻撃は、ターゲットデータポイントの勾配寄与を強調し、バッチ内の他のデータポイントの寄与を抑制するようにサーバーのモデル更新を操作する。
  • ターゲット例が勾配更新において支配的になるように、巧みに設計されたパラメータベクトルを用いる。これにより、逆問題解法の過程で分離可能になる。
  • この手法はモデルに依存せず、クライアントモデルのアーキテクチャやトレーニングプロセスを変更せず、ユーザーに送信されるモデルパラメータのみを変更する。
  • 既存の最適化ベースおよび解析的逆問題解法(例:APRIL)を、勾配拡大によって大規模バッチ勾配で動作可能にする。
  • 攻撃はクロスデバイスおよびクロスシロ設定の両方で適用され、ViTおよびCNNを用いた画像分類の実験が実施された。
  • 従来の手法が勾配の混合により失敗するのに対し、256のバッチサイズから個々のデータポイントの回復が可能になった。

実験結果

リサーチクエスチョン

  • RQ1アーキテクチャの変更なしに、フェデレーテッドラーニングにおける任意の大規模バッチサイズで勾配逆問題攻撃をスケーリングできるか?
  • RQ2サーバーのモデル更新の変更のみで、大規模バッチ勾配から個々のデータポイントを抽出することは可能か?
  • RQ3提案された勾配拡大戦略は、クロスデバイスおよびクロスシロ設定の両方でどの程度有効か?
  • RQ4極端な特徴値を持つデータポイントに対する攻撃の影響は何か?また、代表されていないグループに対して不均等な影響を及えるか?
  • RQ5平均や中央値集約などの標準的な集約防御は、この攻撃を効果的に緩和できるか?

主な発見

  • 提案されたフィッシング攻撃は、ViT-Smallを用いてImageNetで最大RPSNR 21.481を達成し、256のバッチサイズから高忠実度の画像を回復できた。
  • これに対して、元のAPRIL攻撃はバッチサイズ2で失敗し、最大RPSNRが8.422に低下し、従来手法の重大な限界を示している。
  • 攻撃はクロスデバイスおよびクロスシロ設定の両方で有効であり、現実的なフェデレーテッドラーニングシナリオにおける広範な適用可能性を示している。
  • 極端な特徴値を持つ外れ値データポイントは、中央値特徴のものよりもはるかに少ないクエリ数(log(n))で回復可能であり、プライバシー上の不均等な影響が明らかになった。
  • 平均や中央値集約などの標準的な集約防御は、悪意のあるパラメータ設計が依然として勾配更新を支配できるため、この攻撃を防止できない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。