Skip to main content
QUICK REVIEW

[논문 리뷰] FedCL: Federated Contrastive Learning for Privacy-Preserving Recommendation

Chuhan Wu, Fangzhao Wu|arXiv (Cornell University)|2022. 04. 21.
Privacy-Preserving Technologies in Data인용 수 9
한 줄 요약

FedCL은 개인 정보를 보호하는 피어드 컨트라스트 러닝 프레임워크를 제안하여, 중앙 서버에서 로컬으로 추론된 로컬 차별적 개인 정보 보호(Loacl Differential Privacy, LDP) 사용자 임베딩을 활용해 고품질의 반경이 있는 음성 샘플을 식별한다. Ward 군집화를 통해 노이즈가 첨가된 임베딩을 군집화하고 중심점(centroid)을 사용해 음성 샘플을 추출함으로써, 사용자 개인정보를 보호하면서도 모델 성능을 향상시킨다. 이는 네 개의 벤치마크 데이터셋에서 다양한 추천 모델에 대해 유의미한 향상(유의수준 p < 0.001)을 이룬다.

ABSTRACT

Contrastive learning is widely used for recommendation model learning, where selecting representative and informative negative samples is critical. Existing methods usually focus on centralized data, where abundant and high-quality negative samples are easy to obtain. However, centralized user data storage and exploitation may lead to privacy risks and concerns, while decentralized user data on a single client can be too sparse and biased for accurate contrastive learning. In this paper, we propose a federated contrastive learning method named FedCL for privacy-preserving recommendation, which can exploit high-quality negative samples for effective model training with privacy well protected. We first infer user embeddings from local user data through the local model on each client, and then perturb them with local differential privacy (LDP) before sending them to a central server for hard negative sampling. Since individual user embedding contains heavy noise due to LDP, we propose to cluster user embeddings on the server to mitigate the influence of noise, and the cluster centroids are used to retrieve hard negative samples from the item pool. These hard negative samples are delivered to user clients and mixed with the observed negative samples from local data as well as in-batch negatives constructed from positive samples for federated model training. Extensive experiments on four benchmark datasets show FedCL can empower various recommendation methods in a privacy-preserving way.

연구 동기 및 목표

  • 로컬 데이터가 희소하고 편향되어 있는 개인정보 보호 추천 시스템에서 고품질의 음성 샘플을 확보하는 데 도전한다.
  • 중앙 집중식 사용자 데이터 저장 없이도 피어드 환경에서 효과적인 컨트라스트 러닝을 가능하게 하여 개인정보 위험을 최소화한다.
  • 로컬, 배치 내, 반경이 있는 음성 샘플과 같은 다양한 유형의 음성 샘플을 통합된 학습 프레임워크 내에서 결합하는 방법을 설계한다.
  • 특히 노이즈가 첨가된, 훼손된 사용자 임베딩을 다룰 때에도 안정성과 성능을 확보하기 위해 차별적 개인 정보 보호 제약 조건 하에서의 강건성을 확보한다.

제안 방법

  • 클라이언트 기기의 로컬 모델이 원시 데이터를 공유하지 않고도 로컬 사용자 프로필에서 사용자 임베딩을 추론한다.
  • 사용자 임베딩은 전송 전에 라플라스 노이즈를 적용하여 로컬 차별적 개인 정보 보호(LDP)를 만족시킨다.
  • 서버는 노이즈가 첨가된 임베딩에 Ward 계층적 군집화를 적용하여 노이즈를 감소시키고 대표적인 사용자 관심 군집을 식별한다.
  • 군집 중심점을 사용하여 유사도 기반 샘플링 방법을 통해 글로벌 아이템 풀에서 반경이 있는 음성 샘플을 검색한다.
  • 중앙 서버는 이러한 반경이 있는 음성 샘플을 클라이언트로 다시 전송하며, 여기서 로컬 음성 샘플과 배치 내 음성 샘플과 함께 컨트라스트 학습에 사용된다.
  • 음성 샘플 믹스업 전략을 통해 로컬, 배치 내, 반경이 있는 음성 샘플을 하나의 컨트라스트 러닝 목표에 통합하여 모델 일반화 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1중앙 집중식 사용자 데이터 저장 없이도 피어드 환경에서 고품질의 음성 샘플을 효과적으로 식별할 수 있는가?
  • RQ2로컬 차별적 개인 정보 보호를 어떻게 활용하여 사용자 임베딩을 보호하면서도 서버에서 정확한 음성 샘플링을 가능하게 할 수 있는가?
  • RQ3노이즈가 첨가된 LDP-편향 임베딩을 군집화할 경우, 검색된 음성 샘플의 품질에 어떤 영향을 미치는가?
  • RQ4로컬, 배치 내, 반경이 있는 음성 샘플과 같은 다양한 유형의 음성 샘플이 피어드 컨트라스트 러닝에서 모델 성능에 어떤 기여를 하는가?
  • RQ5제안된 프레임워크에서 개인 정보 보호 예산과 모델 성능 사이의 최적의 균형은 무엇인가?

주요 결과

  • FedCL은 네 개의 벤치마크 데이터셋에서 다양한 추천 모델의 성능을 유의미하게 향상시켰으며, 기준 모델 대비 통계적으로 유의미한 성과 향상(유의수준 p < 0.001)을 기록했다.
  • 피어드 샘플링 방법을 통해 검색된 반경이 있는 음성 샘플이 성능 향상에 가장 큰 기여를 하였으며, 일반적으로 잘못된 음성 샘플을 포함할 수 있는 글로벌 하드 음성 샘플보다 우수한 성능을 보였다.
  • 특히 Ward 군집화를 통해 노이즈가 첨가된 임베딩을 군집화하면 노이즈 감소로 인해 음성 샘플링 정확도가 크게 향상되며, K-means에 비해 Ward가 더 뛰어난 성능을 보였다.
  • 최적의 군집 수는 25로, 이보다 적은 군집 수는 관심 영역의 구분이 부족하여 성능이 떨어지고, 더 많은 군집 수는 노이즈 영향이 증가하여 성능 저하를 초래한다.
  • 개인 정보 보호 예산 ε = 4에서 비용-성능 균형이 가장 우수하며, 더 낮은 ε 값(더 강한 노이즈)은 성능 저하를 초래한다.
  • 로컬 음성 샘플이 가용하지 않은 경우에도 이 방법은 효과를 유지하여 반경이 있는 음성 샘플링 구성 요소의 강건성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.