[論文レビュー] Data Poisoning Attacks on Federated Machine Learning
本稿では、フェデレーテッドマルチタスク学習におけるデータ汚染攻撃のための、システムに配慮した最適化手法AT2FLを提案する。最適な攻撃を二段階最適化問題として定式化し、汚染データの陰関数勾配を計算する。実験の結果、AT2FLは実世界のデータセットにおいてモデル性能を著しく劣化させることに成功し、通信プロトコルを介した間接的攻撃を可能にし、フェデレーテッドラーニングシステムにおける深刻な脆弱性を浮き彫りにしている。
Federated machine learning which enables resource constrained node devices (e.g., mobile phones and IoT devices) to learn a shared model while keeping the training data local, can provide privacy, security and economic benefits by designing an effective communication protocol. However, the communication protocol amongst different nodes could be exploited by attackers to launch data poisoning attacks, which has been demonstrated as a big threat to most machine learning models. In this paper, we attempt to explore the vulnerability of federated machine learning. More specifically, we focus on attacking a federated multi-task learning framework, which is a federated learning framework via adopting a general multi-task learning framework to handle statistical challenges. We formulate the problem of computing optimal poisoning attacks on federated multi-task learning as a bilevel program that is adaptive to arbitrary choice of target nodes and source attacking nodes. Then we propose a novel systems-aware optimization method, ATTack on Federated Learning (AT2FL), which is efficiency to derive the implicit gradients for poisoned data, and further compute optimal attack strategies in the federated machine learning. Our work is an earlier study that considers issues of data poisoning attack for federated learning. To the end, experimental results on real-world datasets show that federated multi-task learning model is very sensitive to poisoning attacks, when the attackers either directly poison the target nodes or indirectly poison the related nodes by exploiting the communication protocol.
研究の動機と目的
- フェデレーテッドマルチタスク学習が通信プロトコルの悪用によって攻撃を受けやすい脆弱性を調査すること。
- 任意のターゲットノードおよびソースノードに適応可能な、最適な汚染攻撃を二段階最適化問題として定式化すること。
- 通信コストの高さや遅延するノード(ストラグル)といったフェデレーテッドラーニングのシステムレベルの課題に対処するため、新しい最適化フレームワークを設計すること。
- 実世界のデータセット上でランダムなベースラインと比較して、提案された攻撃戦略の有効性を実証的に検証すること。
提案手法
- フェデレーテッドマルチタスク学習におけるデータ汚染攻撃を、上位問題が汚染データを最適化し、下位問題がグローバルモデルを学習する二段階最適化問題として定式化する。
- ソースノードにおける汚染データの陰関数勾配を効率的に計算する、新しいシステムに配慮した最適化手法AT2FLを導入する。
- 二段階最適化フレームワーク内に回帰および分類タスクをモデル化するために、損失関数の二重定式化(最小二乗損失およびハッジ損失)を採用する。
- 式 (4) で示されるステップサイズの適応戦略を用い、攻撃最適化の過程で勾配信号の強度と収束安定性のバランスを取る。
- 陰関数微分を用いて勾配を導出し、モデル学習プロセス全体にわたるエンドツーエンドのバックプロパゲーションを可能にする。
- 攻撃戦略を、ターゲットノードへの直接的汚染と、通信プロトコルを通じた相関ノードを介した間接的汚染の両方へ適用する。
実験結果
リサーチクエスチョン
- RQ1ノード間の通信プロトコルを悪用することで、フェデレーテッドマルチタスク学習におけるデータ汚染攻撃を効果的に実行できるか?
- RQ2任意のターゲットノードおよびソースノードに適応可能な、最適な汚染攻撃を二段階最適化問題としてどのように定式化できるか?
- RQ3通信コストの高さやストラグルといったシステムレベルの課題が、フェデレーテッドラーニングにおけるデータ汚染攻撃の実行可能性および性能にどの程度影響を及えるか?
- RQ4攻撃更新則におけるステップサイズが、攻撃戦略の収束性および有効性にどのように影響を与えるか?
- RQ5攻撃者が一部のノードを compromise するだけで、ターゲット外の相関ノードに影響を与える間接的攻撃が、モデル性能を著しく劣化させることができるか?
主な発見
- 提案されたAT2FL手法は、EndADおよびHuman Activity Recognitionデータセットの両方で数回の反復後に局所最適解に収束し、アルゴリズムの安定性と有効性を示している。
- ステップサイズ η が大きくなるほど攻撃性能が向上し、すべての攻撃戦略が非攻撃ベースラインを上回るが、η の値が高くなると性能が安定化する。
- EndADおよびHuman Activityデータセットにおいて、AT2FLの下で分類誤差が顕著に増加しており、モデル性能の有効な劣化が確認されている。
- 相関ノードを介した間接的汚染に基づく攻撃戦略は顕著な性能低下を引き起こし、通信プロトコルがリモートでの侵害に悪用可能であることを実証している。
- 下位問題のプライマル部分最適性は反復回数を増やすにつれて減少し、最適化プロセスが意味のある解に収束していることが確認された。
- LandmineおよびParkinson-Totalデータセットにおける実験では、AT2FLの下でも一貫した性能劣化が観察され、攻撃の多様な実世界のデータ分布へのロバスト性が検証された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。