Skip to main content
QUICK REVIEW

[논문 리뷰] Privacy Threats Against Federated Matrix Factorization

Dashan Gao, Ben Tan|arXiv (Cornell University)|2020. 07. 03.
Privacy-Preserving Technologies in Data참고 문헌 17인용 수 12
한 줄 요약

이 논문은 수평, 수직, 연합 전이 행렬 분해(Federated Transfer MF)의 세 가지 데이터 분할 유형에서 연합 행렬 분해(Federated Matrix Factorization, MF)의 프라이버시 위협을 식별하고 분석한다. 또한 정직하지만 호기심이 많은 참가자가 개인 사용자 선호도, 사용자 ID 및 프로필 데이터를 유추할 수 있음을 입증한다. 이에 따라 암호화 기반, 왜곡 기반, 하드웨어 기반의 프라이버시 보존 기법을 제안하여 이러한 위험을 완화하며, 연합 MF에서의 프라이버시 위협에 대한 첫 번째 종합적인 연구로 평가된다.

ABSTRACT

Matrix Factorization has been very successful in practical recommendation applications and e-commerce. Due to data shortage and stringent regulations, it can be hard to collect sufficient data to build performant recommender systems for a single company. Federated learning provides the possibility to bridge the data silos and build machine learning models without compromising privacy and security. Participants sharing common users or items collaboratively build a model over data from all the participants. There have been some works exploring the application of federated learning to recommender systems and the privacy issues in collaborative filtering systems. However, the privacy threats in federated matrix factorization are not studied. In this paper, we categorize federated matrix factorization into three types based on the partition of feature space and analyze privacy threats against each type of federated matrix factorization model. We also discuss privacy-preserving approaches. As far as we are aware, this is the first study of privacy threats of the matrix factorization method in the federated learning framework.

연구 동기 및 목표

  • 특성 공간 분할 기반으로 연합 행렬 분해를 세 유형으로 분류하는 것: 수평, 수직, 연합 전이 MF.
  • 각 연합 MF 유형에서의 프라이버시 위협을 분석하여, 정직하지만 호기심이 많은 참가자가 개인 사용자 선호도, 사용자 ID 및 프로필 데이터를 어떻게 유추할 수 있는지 규명하는 것.
  • 각 연합 MF 설정이 유추 공격에 대해 얼마나 견고한지 평가하는 것.
  • 암호화, 왜곡, 하드웨어 기반 방법을 포함한 프라이버시 보존 기법을 제안하고 논의하여 연합 학습 중 민감한 데이터를 보호하는 것.
  • 향후 공격 효과성의 실증적 평가 기반과 대체로 암시적 최소 제곱법(Alternating Least Squares)과 같은 다른 MF 변종으로의 확장에 기초를 마련하는 것.

제안 방법

  • 데이터 및 파라미터 분할 기반으로 연합 MF를 세 유형으로 분류: 수평(공유되는 사용자/아이템), 수직(이질적 특성), 연합 전이(공유되는 사용자/아이템와 부분 모델 파라미터).
  • 정직하지만 호기심이 많은 위협 모델 하에서 학습 과정을 모델링하며, 참가자들이 기울기와 공유된 파라미터를 통해 개인 데이터를 추론하도록 공모하는 상황을 고려한다.
  • 기울기 및 파라미터 교환 패턴을 분석하여 사용자 ID, 사용자 선호도, 프로필 행렬에 대한 泄露 벡터를 규명한다.
  • 중간 계산을 보호하기 위해 히든 암호화(HE)와 비밀 공유 기법을 포함한 암호화 솔루션을 제안한다.
  • 다변수 프라이버시(DP)와 같은 왜곡 기반 방법을 평가하지만, 데이터 희소성로 인한 노이즈 문제 발생 가능성을 언급한다.
  • 기초적으로 신뢰할 수 있는 실행 환경(TEEs)을 사용한 하드웨어 기반 접근 방식을 논의하여 학습 계산을 격리하고 보호한다.

실험 결과

연구 질문

  • RQ1연합 학습 환경에서 수평, 수직, 연합 전이 행렬 분해에 대해 각각 어떤 독특한 프라이버시 위협이 존재하는가?
  • RQ2정직하지만 호기심이 많은 참가자가 연합 MF의 모델 업데이트에서 개인 사용자 선호도, 사용자 ID 또는 프로필 데이터를 어떻게 추론할 수 있는가?
  • RQ3파라미터 공유 및 기울기 노출에 기반한 유추 공격에 대해 각 연합 MF 설정의 상대적 내구성은 어떠한가?
  • RQ4암호화, 왜곡, 하드웨어 격리 중 어떤 프라이버시 보존 기법이 연합 MF를 보호하는 데 가장 효과적인가?
  • RQ5데이터 희소성과 모델 구조는 연합 MF에서의 다변수 프라이버시의 실현 가능성과 노이즈 영향에 어떤 영향을 미치는가?

주요 결과

  • 수평 연합 MF는 전체 모델 파라미터 공유로 인해 사용자 ID 및 완전한 사용자 선호도 데이터를 포함한 가장 많은 개인 정보를暴露한다.
  • 수직 연합 MF에서는 추천 시스템이 공유된 파라미터를 통해 사용자 ID를 유추할 수 있지만, 보조 데이터 제공자는 추천 시스템에게 정보를 泄露하지 않는다.
  • 연합 전이 MF는 개인 평가 점수와 사용자/아이템 프로필을 泄露하지만 사용자 ID는 폭 드러나지 않아 중간 수준의 내구성을 제공한다.
  • 연합 MF의 기울기 및 파라미터 교환 과정은 높은 정확도로 개인 학습 데이터를 재구성할 수 있는 유추 공격을 가능하게 한다.
  • 히든 암호화 및 비밀 공유와 같은 암호화 기법은 중간 데이터 보호에 효과적이지만, 통신 오버헤드 문제가 여전히 남아 있다.
  • 다변수 프라이버시는 희소한 MF 환경에서 과도한 노이즈를 유발할 수 있어 모델 유틸리티를 감소시키지만, TEEs는 강력한 격리 기능을 제공하지만 하드웨어 신뢰 가정에 의존한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.