Skip to main content
QUICK REVIEW

[論文レビュー] A Coupled Design of Exploiting Record Similarity for Practical Vertical Federated Learning

Zhaomin Wu, Qinbin Li|arXiv (Cornell University)|Jun 11, 2021
Privacy-Preserving Technologies in Data被引用数 6
ひとこと要約

本稿では、曖昧な識別子間の類似度スコアを活用して、1対多のレコードリンクとモデル学習を統合することで、垂直フェデレーテッドラーニング(VFL)のための新しいカップリング型トレーニングフレームワークであるFedSimを提案する。類似度に基づいてリンクされたレコードの重みを動的に設定し、トレーニング中にこれらの重みを調整することで、曖昧なリンクと正確なリンクの両状況において性能を向上させ、8つのデータセットにおいて最先端のベースラインを上回る。また、プライバシー解析と提案されたグリーディ推論攻撃に対する防御機構も提供する。

ABSTRACT

Federated learning is a learning paradigm to enable collaborative learning across different parties without revealing raw data. Notably, vertical federated learning (VFL), where parties share the same set of samples but only hold partial features, has a wide range of real-world applications. However, most existing studies in VFL disregard the "record linkage" process. They design algorithms either assuming the data from different parties can be exactly linked or simply linking each record with its most similar neighboring record. These approaches may fail to capture the key features from other less similar records. Moreover, such improper linkage cannot be corrected by training since existing approaches provide no feedback on linkage during training. In this paper, we design a novel coupled training paradigm, FedSim, that integrates one-to-many linkage into the training process. Besides enabling VFL in many real-world applications with fuzzy identifiers, FedSim also achieves better performance in traditional VFL tasks. Moreover, we theoretically analyze the additional privacy risk incurred by sharing similarities. Our experiments on eight datasets with various similarity metrics show that FedSim outperforms other state-of-the-art baselines. The codes of FedSim are available at https://github.com/Xtra-Computing/FedSim.

研究の動機と目的

  • 既存のVFLシステムが正確なもしくは1対1のレコードリンクに依存するという限界に対処し、類似度が低いが関連性のあるレコードの重要な特徴を捉えることができない問題を解決すること。
  • リンクとトレーニングプロセスを分離することで生じる性能劣化を克服し、モデル最適化のフィードバックがリンク品質の向上に寄与するようにすること。
  • 実世界の応用で一般的に見られる曖昧な識別子(例:住所、GPS座標、タイトル)をサポートするスケーラブルでプライバシーに配慮したVFLフレームワークを設計すること。
  • 類似度スコアの共有によって生じるプライバシーリスクを分析し、攻撃成功確率の理論的上限を提示する防御機構を提案すること。
  • 類似度スコアのメトリクスが異なる多様なデータセットにおいて、FedSimが最先端のVFLベースラインを優まさることを実証すること。

提案手法

  • FedSimは、類似度に依存するリンク重みとモデル重みを同時に最適化するカップリング型トレーニングパラダイムを導入し、高類似度のリンクされたレコードを優先する類似度認識損失関数を用いる。
  • SplitNNアーキテクチャを拡張して、セカンドリーパartyが中間表現をプライマリーパartyに送信できるようにし、集約段階で類似度スコアを学習可能なアテンション重みとして統合する。
  • フレームワークは、各リンクされたレコードの寄与度をそのターゲットとの類似度に応じて動的に調整し、トレーニング損失を最小化するように繰り返し重みを更新する。
  • プライバシー保護のため、類似度スコアを共有する前にガウスノイズを適用し、微分プライバシーの下でのリスクを分析。その結果、強い保証を得るには不十分であることが示された。
  • プライバシーのテストのためにグリーディ推論攻撃を提案し、理論的解析を用いてこの攻撃の成功確率を境界づける防御機構を導入した。
  • 1対多のリンクを実現するため、各ターゲットに対して類似度が最も高いK件のレコードを選択し、効率性と情報保持のバランスを取る。

実験結果

リサーチクエスチョン

  • RQ1類似度に基づく1対多のリンクを統合したカップリング型トレーニングフレームワークは、1対1または1対すべてのリンクを越えて、垂直フェデレーテッドラーニングにおける性能を向上させることができるか?
  • RQ2類似度スコアをトレーニングプロセスに統合することで、曖昧な識別子を伴うVFLにおけるモデルの精度と収束性にどのような影響を与えるか?
  • RQ3VFLにおいて類似度スコアを共有することで生じるプライバシーリスクは何か? そして、それらを定量的に境界づけることは可能か?
  • RQ4提案されたフレームワークは、類似度メトリクスが異なる多様な実世界のデータセットにおいて、既存の最先端VFLベースラインを上回ることができるか?
  • RQ5このフレームワークは複数パーティVFLへ拡張可能か? スケーラビリティを実現するための仮定は何か?

主な発見

  • FedSimは、住宅価格予測やゲーム推薦といった実世界の応用を含む8つのデータセットにおいて、最先端のVFLベースラインを常に上回る精度の向上を達成した。
  • GPS座標やゲームタイトルなどの曖昧な識別子を伴う状況では、従来の1対1リンクが関連する特徴を捉えられない場合でも、フレームワークは顕著な性能向上を達成した。
  • 正確な識別子を伴うデータセットでは、FedSimはベースラインと同等の性能を維持するが、Kが大きすぎる場合には性能が劣ることがあり、ハイパーパrameter選択に敏感であることが示された。
  • 提案されたグリーディ攻撃は、類似度スコアから識別子を非無視的な確率で推論可能であることが確認され、類似度共有システムにおけるプライバシー保護の必要性を裏付けた。
  • 理論的解析により、グリーディ攻撃の成功確率が境界づけられ、防御機構が現実的な仮定のもとで成功した推論の確率を効果的に低減した。
  • プライマリーパartyがより情報の多い特徴を保持するという仮定の下で、FedSimは複数パーティVFLへスケーラブルに拡張可能であり、セカンドリーパartyに対して1対1のリンクが性能損ないなしに可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。