Skip to main content
QUICK REVIEW

[論文レビュー] FedCL: Federated Contrastive Learning for Privacy-Preserving Recommendation

Chuhan Wu, Fangzhao Wu|arXiv (Cornell University)|Apr 21, 2022
Privacy-Preserving Technologies in Data被引用数 9
ひとこと要約

FedCL は、中央サーバー上で高品質な準ハードネガティブサンプルを同定するために、局所的に推論され、局所的微分プライバシー(LDP)で保護されたユーザー埋め込みを活用する、推薦のためのプライバシー保護型フェデレーテッドコントラスト学習フレームワークを提案する。Wardクラスタリングを用いてノイズを低減し、クラスターセンターオブジェクトを用いてネガティブサンプリングを行うことで、ユーザーのプライバシーを保護しながらモデル性能を向上させ、4つのベンチマークデータセットにおいてさまざまな推薦モデルを一貫して向上させ、顕著な向上(p < 0.001)を達成する。

ABSTRACT

Contrastive learning is widely used for recommendation model learning, where selecting representative and informative negative samples is critical. Existing methods usually focus on centralized data, where abundant and high-quality negative samples are easy to obtain. However, centralized user data storage and exploitation may lead to privacy risks and concerns, while decentralized user data on a single client can be too sparse and biased for accurate contrastive learning. In this paper, we propose a federated contrastive learning method named FedCL for privacy-preserving recommendation, which can exploit high-quality negative samples for effective model training with privacy well protected. We first infer user embeddings from local user data through the local model on each client, and then perturb them with local differential privacy (LDP) before sending them to a central server for hard negative sampling. Since individual user embedding contains heavy noise due to LDP, we propose to cluster user embeddings on the server to mitigate the influence of noise, and the cluster centroids are used to retrieve hard negative samples from the item pool. These hard negative samples are delivered to user clients and mixed with the observed negative samples from local data as well as in-batch negatives constructed from positive samples for federated model training. Extensive experiments on four benchmark datasets show FedCL can empower various recommendation methods in a privacy-preserving way.

研究の動機と目的

  • 局所データがスパースでバイアスがかかる状況において、プライバシー保護型推薦システムで高品質なネガティブサンプルを取得する課題に対処すること。
  • 中央集権的なユーザーデータの保存を避けながら、フェデレーテッド環境で効果的なコントラスト学習を可能にすること、プライバシーリスクを最小限に抑えること。
  • 局所的、バッチ内、および準ハードネガティブサンプルの複数のタイプを統合的なトレーニングフレームワーク内で統合すること。
  • 特にノイズの多い、摂動されたユーザー埋め込みを対象とした微分プライバシー制約下でも、モデルの頑健性と性能を保証すること。

提案手法

  • クライアントデバイス上のローカルモデルが、生データを共有せずにローカルユーザープロファイルからユーザー埋め込みを推論する。
  • ユーザー埋め込みは、送信前にラプラスノイズで摂動され、局所的微分プライバシー(LDP)を満たす。
  • サーバーは摂動された埋め込みに対してWard階層的クラスタリングを適用し、ノイズを低減し、代表的なユーザー関心クラスタを同定する。
  • クラスターセンターオブジェクトを用いて、類似度ベースのサンプリング手法により、グローバルアイテムプールから準ハードネガティブサンプルを取得する。
  • 中央サーバーはこれらの準ハードネガティブサンプルをクライアントに送信し、そこでローカルおよびバッチ内ネガティブサンプルと統合されてコントラスト学習に用いられる。
  • ネガティブサンプルのミックスアップ戦略により、ローカル、バッチ内、および準ハードネガティブサンプルが単一のコントラスト学習目的に統合され、モデルの汎化性能が向上する。

実験結果

リサーチクエスチョン

  • RQ1中央集権的なユーザーデータの保存がなく、フェデレーテッド環境で高品質なネガティブサンプルを効果的に同定できるか?
  • RQ2局所的微分プライバシーを活用することで、ユーザー埋め込みを保護しつつ、サーバー上で正確なネガティブサンプリングを可能にする方法は何か?
  • RQ3ノイズの多いLDP摂動埋め込みをクラスタリングすることで、取得されたネガティブサンプルの品質にどのような影響を与えるか?
  • RQ4ローカル、バッチ内、準ハードネガティブサンプルといった異なるタイプのネガティブサンプルは、フェデレーテッドコントラスト学習におけるモデル性能にどのように寄与するか?
  • RQ5提案されたフレームワークにおいて、プライバシー予算とモデル性能の最適なバランスは何か?

主な発見

  • FedCL は、4つのベンチマークデータセットにおいて、さまざまな推薦モデルの性能を顕著に向上させ、ベースラインと比較して統計的に有意な向上(p < 0.001)を達成した。
  • フェデレーテッドサンプリング手法により取得された準ハードネガティブサンプルが、最も性能向上に寄与しており、しばしば誤ったネガティブサンプルを含むグローバルに最も難しいネガティブサンプルを上回った。
  • 特にWardクラスタリングを用いた摂動された埋め込みのクラスタリングは、ノイズ低減によりネガティブサンプリングの正確性を顕著に向上させ、WardがK-meansを上回った。
  • クラスタ数の最適値は25であり、クラスタ数が少ないと関心の区別が不十分になり、多すぎるとノイズの影響が増大し、性能が低下する。
  • プライバシー予算ε = 4が、プライバシー保護とモデル性能の間で良好なトレードオフを実現しており、εをさらに小さくすると(ノイズを強くすると)性能が劣化した。
  • ローカルネガティブサンプルが利用できない状況でも、本手法は依然として有効であり、準ハードネガティブサンプリング部の頑健性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。