Skip to main content
QUICK REVIEW

[論文レビュー] Compressed-VFL: Communication-Efficient Learning with Vertically Partitioned Data

Timothy Castiglia, Anirban Das|arXiv (Cornell University)|Jun 16, 2022
Privacy-Preserving Technologies in Data被引用数 5
ひとこと要約

本稿では、垂直に分割されたデータにおける通信効率の高いフレームワークとして、Compressed Vertical Federated Learning (C-VFL) を提案する。参加者はモデルの埋め込み表現を共有する前に圧縮することで、精度に顕著な損失を伴わず90%以上の通信量削減を実現する。本稿は、VFLにおける埋め込み圧縮のための最初の理論的収束解析を提供し、圧縮誤差が有界である場合に $O(1/√{T})$ の収束レートを示し、量子化およびtop-$k$ スパarsificationを用いた収束のための条件を確立する。

ABSTRACT

We propose Compressed Vertical Federated Learning (C-VFL) for communication-efficient training on vertically partitioned data. In C-VFL, a server and multiple parties collaboratively train a model on their respective features utilizing several local iterations and sharing compressed intermediate results periodically. Our work provides the first theoretical analysis of the effect message compression has on distributed training over vertically partitioned data. We prove convergence of non-convex objectives at a rate of $O(\frac{1}{\sqrt{T}})$ when the compression error is bounded over the course of training. We provide specific requirements for convergence with common compression techniques, such as quantization and top-$k$ sparsification. Finally, we experimentally show compression can reduce communication by over $90\%$ without a significant decrease in accuracy over VFL without compression.

研究の動機と目的

  • 垂直に分割されたデータにおける大規模な埋め込み表現に起因するVFLの高い通信コストを低減すること。
  • 従来の水平フェデレーテッドラーニングにおける勾配圧縮とは異なり、中間埋め込み表現の圧縮によりVFLにおける通信効率を向上させること。
  • VFLにおける埋め込み圧縮の収束に関する最初の理論的解析を提供し、収束が保たれる条件を確立すること。
  • 一般的な技術(例:量子化やtop-$k$ スパースフィケーション)における圧縮パラメータの具体的な境界を導出することで、実用的適用性を確保すること。
  • 実験的に、圧縮により通信量を90%以上削減しつつ、モデル精度にほとんど影響を与えないことを示すこと。

提案手法

  • C-VFLは、複数の局所イテレーション(Q > 1)を用いたブロック座標降下法を採用し、グローバル通信の頻度を低減する。
  • 参加者はニューラルネットワークを用いて局所的な埋め込みを計算し、量子化やtop-$k$ スパースフィケーションなどの技術を用いてそれを圧縮してサーバーに送信する。
  • サーバーは圧縮された埋め込みを統合し、グローバル損失を計算した後、各参加者の埋め込みに関する勾配のみを送信することで通信量を削減する。
  • 各参加者は、連鎖律を用いて局所勾配を計算する:$\nabla_{m}F = \nabla_{\theta_{m}}h_{m} \cdot \nabla_{h_{m}}F$ により、局所モデルの更新が可能になる。
  • 本フレームワークは任意のサーバーモデルをサポートし、埋め込みレベルでの圧縮を可能にすることで、従来のVFL手法を一般化する。
  • 2種類のアルゴリズムバージョンを用いる:Q > 1 の場合に使用する Algorithm 1(複数の局所ステップ)、Q = 1 の場合に使用する Algorithm 2(1ラウンドあたり1回の圧縮埋め込み転送)

実験結果

リサーチクエスチョン

  • RQ1VFLにおける埋め込み圧縮は、モデルの収束性や精度を著しく低下させることなく、顕著な通信量削減を達成できるか?
  • RQ2VFLにおける圧縮誤差にどのような理論的条件が課されると、グローバルモデルの収束が保証されるか?
  • RQ3量子化やtop-$k$ スパースフィケーションといった一般的な圧縮技術がVFLの収束に与える影響は何か?また、収束を保証するためのパラメータ設定は何か?
  • RQ4C-VFLにおいてQ>1の複数の局所イテレーションを用いることで、1イテレーションのみの転送と比較して、総通信コストを低減できるか(1ラウンドあたりのコストは高くなるが)?
  • RQ5MIMIC-IIIなどの実世界のデータセットにおいて、C-VFLは通信量を90%以上削減しながらも、高いモデル精度を維持できるか?

主な発見

  • C-VFLは、非圧縮VFLと比較してMIMIC-IIIデータセットで通信コストを90%以上削減し、精度の低下は最小限に抑えられる。
  • F1スコアの目標値0.4に到達するための通信コストは、圧縮なしの場合の4517.59 MBから、Q=25の3ビットベクタ量子化を用いた場合に125.09 MBにまで低下した。
  • Q=1の場合、Algorithm 2は1ラウンドあたりの通信コストを削減するが、グローバルラウンド数が増加するため、Q>1のAlgorithm 1に比べて総通信コストが高くなる。
  • 理論的解析により、圧縮誤差が有界である場合に $O(1/\sqrt{T})$ の収束レートが保証され、非圧縮VFLと同等の性能を達成することが示された。
  • 量子化の場合、3ビット表現が圧縮誤差が有界である限り収束を保証する。top-$k$ スパースフィケーションの場合、スパarsityレベルが十分に高い必要がある。
  • 実験的結果から、Q>1を用いることで、1ラウンドあたりのコストが高くなるものの、必要なグローバルラウンド数が減少するため、総通信コストがQ=1よりも顕著に低減することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。