Skip to main content
QUICK REVIEW

[論文レビュー] Secure Federated Clustering

Songze Li, Sizai Hou|arXiv (Cornell University)|May 31, 2022
Privacy-Preserving Technologies in Data被引用数 8
ひとこと要約

本稿では、情報理論的データプライバシーを保証しながら、中央集権的k-meansクラスタリングと正確に同一のパフォーマンスを達成するセキュアなフェデレーテッドクラスタリング手法であるSecFCを提案する。この手法はラグランジュ符号化されたデータ共有と符号化データ上の安全計算を用い、サーバーや協調するクライアントにクライアントデータやクラスタ中心を漏洩させることなく、正確なLloydのアルゴリズムを実行可能にする。

ABSTRACT

We consider a foundational unsupervised learning task of $k$-means data clustering, in a federated learning (FL) setting consisting of a central server and many distributed clients. We develop SecFC, which is a secure federated clustering algorithm that simultaneously achieves 1) universal performance: no performance loss compared with clustering over centralized data, regardless of data distribution across clients; 2) data privacy: each client's private data and the cluster centers are not leaked to other clients and the server. In SecFC, the clients perform Lagrange encoding on their local data and share the coded data in an information-theoretically private manner; then leveraging the algebraic structure of the coding, the FL network exactly executes the Lloyd's $k$-means heuristic over the coded data to obtain the final clustering. Experiment results on synthetic and real datasets demonstrate the universally superior performance of SecFC for different data distributions across clients, and its computational practicality for various combinations of system parameters. Finally, we propose an extension of SecFC to further provide membership privacy for all data points.

研究の動機と目的

  • クライアント間で非一様なデータ分布が生じる状況下でも、既存のフェデレーテッドクラスタリング手法のパフォーマンス劣化を解消すること。
  • k-FEDなどの最先端手法において、クラスタ中心とデータ分布がサーバーに露呈するというプライバシー漏洩を克服すること。
  • 協調するクライアントと好奇なサーバーに対して、クライントデータおよびクラスタ中心の情報理論的プライバシーを達成すること。
  • パフォーマンスやセキュリティを損なわずに、所属プライバシー(どのクライアントがどのデータポイントを所有しているか)を保護するフレームワークの拡張を実現すること。
  • さまざまなシステムパラメータ下で、合成データおよび実世界のデータセットに対して計算上の実用性と耐障害性を実証すること。

提案手法

  • クライアントは局所データにラグランジュ多項式符号化を適用し、ランダムノイズを混ぜて符号化されたデータ共有を生成する。
  • 符号化されたデータセグメントは、秘密分散を用いてすべてのクライアント間で安全に共有され、単一のクライアントやサーバーが元のデータを再構築できないようにする。
  • ラグランジュ符号化の代数的構造を活用し、各クライアントがクラスタ中心とデータポイント間の距離の秘密共有を局所的に計算できるようにする。
  • サーバーは十分な数の秘密共有を集約し、実際のデータポイントやクラスタ中心の値を学習せずに、ペアワイズ距離を再構築できる。
  • Lloydのアルゴリズムは、中央集権的k-meansと同一に実行され、中心の更新には再構築された距離のみが使用される。
  • 拡張版では、プライベートセットユニオン(PSU)プロトコルを統合し、クライアント間でのデータポイントIDを同期化することで、所有権を隠蔽し、所属プライバシーを実現する。

実験結果

リサーチクエスチョン

  • RQ1フェデレーテッドk-meansクラスタリング手法は、クライアント間のデータ分布にかかわらず、中央集権的k-meansと同一のパフォーマンスを達成できるか?
  • RQ2フェデレーテッドクラスタリング環境において、クライアントデータおよびクラスタ中心の情報理論的プライバシーを達成できるか?
  • RQ3提案手法は、任意のデータ分布および変動する局所クラスタ数のもとでも高いパフォーマンスと強固なプライバシーを維持できるか?
  • RQ4クラスタリングの正確性やセキュリティを損なわずに、さらなる所属プライバシー保護(どのクライアントがどのデータポイントを所有しているか)を実現できるか?
  • RQ5提案手法は、多様なシステム構成および実世界のデータセットにおいて、通信量および計算量の面でどのようにスケーリングするか?

主な発見

  • SecFCは、データ分布やクライアントごとの局所クラスタ数にかかわらず、中央集権的Lloydアルゴリズムと同一のクラスタリングパフォーマンスを達成する。
  • k-FEDとは異なり、クライアントあたりの局所クラスタ数がグローバルkに近づくと著しく性能が低下するが、SecFCはこのような変動に対してパフォーマンスが不変である。
  • MNISTの数字クラスタリングタスクにおいて、k′ = kであっても、SecFCはk-FEDを一貫して上回り、中央集権的ベースラインと一致する。
  • 本手法は情報理論的プライバシーを維持している:いかなるクライアントやサーバーも元のデータポイントやクラスタ中心を再構築できない。
  • プライベートID同期を統合した拡張版SecFCは、データ所有権を効果的に隠蔽し、所属プライバシーを確保しながらもクラスタリングの正確性を維持している。
  • 実験により、SecFCはクライアント数、データサイズ、クラスタ数の異なるさまざまなシステムパラメータ下でも、計算上の実用性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。