[論文レビュー] A Vertical Federated Learning Framework for Horizontally Partitioned Labels
本稿では、ラベルが水平に分散されている(つまり、どの参加者もすべてのラベルを保有しない)状況下で、プライバシーを守りながら深層ニューラルネットワークを訓練できる新しいフレームワーク、カスケード垂直フェデレーテッドラーニング(CVFL)を提案する。本手法は、段階的集約メカニズムと新たな最適化目的関数を活用することで、中央集権的学習と同等の性能を達成し、リソース制限のある環境におけるスローワー問題を顕著に軽減する。
Vertical federated learning is a collaborative machine learning framework to train deep leaning models on vertically partitioned data with privacy-preservation. It attracts much attention both from academia and industry. Unfortunately, applying most existing vertical federated learning methods in real-world applications still faces two daunting challenges. First, most existing vertical federated learning methods have a strong assumption that at least one party holds the complete set of labels of all data samples, while this assumption is not satisfied in many practical scenarios, where labels are horizontally partitioned and the parties only hold partial labels. Existing vertical federated learning methods can only utilize partial labels, which may lead to inadequate model update in end-to-end backpropagation. Second, computational and communication resources vary in parties. Some parties with limited computational and communication resources will become the stragglers and slow down the convergence of training. Such straggler problem will be exaggerated in the scenarios of horizontally partitioned labels in vertical federated learning. To address these challenges, we propose a novel vertical federated learning framework named Cascade Vertical Federated Learning (CVFL) to fully utilize all horizontally partitioned labels to train neural networks with privacy-preservation. To mitigate the straggler problem, we design a novel optimization objective which can increase straggler's contribution to the trained models. We conduct a series of qualitative experiments to rigorously verify the effectiveness of CVFL. It is demonstrated that CVFL can achieve comparable performance (e.g., accuracy for classification tasks) with centralized training. The new optimization objective can further mitigate the straggler problem comparing with only using the asynchronous aggregation mechanism during training.
研究の動機と目的
- 既存の垂直フェデレーテッドラーニング手法が、少なくとも1つの参加者がすべてのラベルを保有する必要があるという制限を克服すること。これは、現実のシナリオではしばしば実現不可能である。
- ラベルが水平に分散されている状況で、エンドツーエンドのバックプロパゲーションにおいてラベルの部分的利用がもたらす性能劣化を是正すること。
- 参加者が計算および通信リソースが不均一な状況下でも、垂直フェデレーテッドラーニングにおけるスローワー問題を軽減すること。
- すべての参加者に存在するラベルを完全に活用しつつ、データプライバシーを保持する学習フレームワークを設計すること。
提案手法
- 各参加者が自身が保有するローカルなラベルのみを用いてモデル更新に貢献できる段階的集約メカニズムを導入し、グローバルなラベルの可用性を必要としない。
- スローワー参加者の貢献度を高めるために、ローカルデータの品質と可用性に基づいて勾配更新を動的に調整する、新たな最適化目的関数を提案する。
- 特徴レベルのデータ同期とセキュア集約を用いて、参加者が共同で共有された深層ニューラルネットワークを訓練する垂直フェデレーテッドラーニングアーキテクチャを採用する。
- 参加者間で生データやラベルを共有しないようにセキュア集約プロトコルを用いることで、プライバシーを確保する。
- ローカルモデルの更新とグローバルモデルの集約を交互に実行する学習パイプラインを設計し、スローワーに配慮した最適化を組み込むことで収束性を向上させる。
- 非同期集約と適応的重み付けを用いることで、遅延や低リソース参加者の全体の学習速度および精度への影響を低減する。
実験結果
リサーチクエスチョン
- RQ1ラベルが参加者間で水平に分散されている状況下で、どの参加者もすべてのラベルを保有しない条件下でも、垂直フェデレーテッドラーニングフレームワークが深層ニューラルネットワークを効果的に学習できるか。
- RQ2参加者が計算および通信能力にばらつきを持つ状況下で、垂直フェデレーテッドラーニングにおけるスローワー問題をどのように軽減できるか。
- RQ3ラベルカバレッジが不完全なフェデレーテッドラーニング環境下で、低リソースまたは遅延の大きい参加者の貢献度を高めるためにどのような最適化目的関数が有効か。
- RQ4水平にラベルが分散されている状況下でも、プライバシー保護型フェデレーテッドラーニングフレームワークが中央集権的学習と同等の性能を達成できるまでの程度はどの程度か。
主な発見
- CVFLは中央集権的学習と同等の分類精度を達成しており、参加者間でラベルを完全に活用できることから、水平にラベルが分散されている状況下でも高性能なモデル学習が可能であることを示している。
- 提案された最適化目的関数は、非同期集約のみを用いる場合と比較して、収束速度とモデル精度を顕著に向上させ、特にスローワーが存在する状況で顕著な効果を示している。
- 適応的勾配重み付けにより、低リソース参加者の有効な貢献度を高めることで、フレームワークがスローワー問題を効果的に軽減している。
- 実験結果から、CVFLは一部の参加者が計算または通信リソースが限られている状況下でも、高いモデル性能を維持できており、同様の条件下でベースライン手法を上回っていることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。