Skip to main content
QUICK REVIEW

[논문 리뷰] Machine Unlearning of Federated Clusters

Chao Pan, Jin Sima|arXiv (Cornell University)|2022. 10. 28.
Privacy-Preserving Technologies in Data인용 수 5
한 줄 요약

이 논문은 페더레이티드 클러스터링을 위한 최초의 머신 언리닝 프레임워크인 MUFC를 소개한다. 이는 새로운 희소 압축 다중집합 집계(Sparse Compressed Multiset Aggregation, SCMA) 기반으로 통신 복잡도가 로그형이 되는 방식으로 효율적이고 프라이버시를 보장하는 클라이언트 데이터 제거를 가능하게 한다. 이 방법은 완전 재학습 대비 평균 84배 빠른 언리닝 성능을 달성하면서도, 특히 클러스터 크기가 불균형한 상황에서도 뛰어난 클러스터링 성능을 유지한다.

ABSTRACT

Federated clustering (FC) is an unsupervised learning problem that arises in a number of practical applications, including personalized recommender and healthcare systems. With the adoption of recent laws ensuring the "right to be forgotten", the problem of machine unlearning for FC methods has become of significant importance. We introduce, for the first time, the problem of machine unlearning for FC, and propose an efficient unlearning mechanism for a customized secure FC framework. Our FC framework utilizes special initialization procedures that we show are well-suited for unlearning. To protect client data privacy, we develop the secure compressed multiset aggregation (SCMA) framework that addresses sparse secure federated learning (FL) problems encountered during clustering as well as more general problems. To simultaneously facilitate low communication complexity and secret sharing protocols, we integrate Reed-Solomon encoding with special evaluation points into our SCMA pipeline, and prove that the client communication cost is logarithmic in the vector dimension. Additionally, to demonstrate the benefits of our unlearning mechanism over complete retraining, we provide a theoretical analysis for the unlearning performance of our approach. Simulation results show that the new FC framework exhibits superior clustering performance compared to previously reported FC baselines when the cluster sizes are highly imbalanced. Compared to completely retraining K-means++ locally and globally for each removal request, our unlearning procedure offers an average speed-up of roughly 84x across seven datasets. Our implementation for the proposed method is available at https://github.com/thupchnsky/mufc.

연구 동기 및 목표

  • GDPR 및 CCPA와 같은 개인정보 보호 규정 하에서 페더레이티드 클러스터링에 대한 머신 언리닝의 필수적 필요성을 해결하기 위해.
  • 완전 재학습 없이도 효율적인 데이터 제거가 가능한 보안적이고 통신 효율적인 페더레이티드 클러스터링 시스템을 설계하기 위해.
  • 서버는 개별 클라이언트 데이터가 아닌 클러스터 수의 합만을 알 수 있도록 보장하는 새로운 희소 압축 다중집합 집계(SCMA) 프로토콜을 개발하기 위해.
  • 이론적 및 실증적으로 언리닝이 완전 재학습보다 훨씬 빠르다는 것을 입증하기 위해.
  • 실제 생물의학적 응용 분야에서 페더레이티드 언리닝을 평가하기 위한 기준 데이터셋(암 유전체학 및 장내 미생물군 데이터 포함)을 제공하기 위해.

제안 방법

  • 전역 클러스터링 목표의 순서 최적 근사치를 달성하는 일괄 처리 페더레이티드 K-means++ 클러스터링 알고리즘을 제안한다.
  • 벡터 차원에 대해 로그형 통신 비용을 달성하기 위해 리드-소울먼 코드와 특별히 선택된 평가 점수를 조합한 보안 집계 프레임워크인 SCMA를 도입한다.
  • 비밀 공유 및 압축된 다중집합 집계를 사용하여 서버가 개별 클라이언트 벡터 분포를 알 수 없고 오직 합계만을 알 수 있도록 보장한다.
  • 완전 재학습에 비해 효율적인 언리닝과 호환되는, 자체적으로 효율적인 초기화 절차를 FC 프레임워크에 통합한다.
  • 루트 오브 언리티의 평가 점수를 사용하여 리드-소울먼 코드를 다중집합 집계에 효율적이고 안전하며 저복잡도로 통합한다.
  • 영향을 받는 클라이언트와 서버만을 업데이트하는 언리닝 메커니즘을 설계하여, 각 데이터 제거 요청 후 완전 재학습을 피한다.

실험 결과

연구 질문

  • RQ1특정 클라이언트 데이터의 영향을 완전 재학습 없이 효율적으로 제거할 수 있는 방식으로 페더레이티드 클러스터링을 언리닝 가능하게 만들 수 있는가?
  • RQ2클라이언트 프라이버시를 보존하면서도 클러스터링에서 효율적 언리닝을 가능하게 하기 위해 보안 집계를 어떻게 설계할 수 있는가?
  • RQ3페더레이티드 클러스터링 시스템에서 언리닝의 이론적 및 실증적 복잡도는 완전 재학습에 비해 어떻게 되는가?
  • RQ4매우 불균형한 클러스터 크기 상황에서 제안된 방법은 어떻게 성능을 발휘하는가? 이는 실세계에서 흔한 과제이다.
  • RQ5제안된 프레임워크는 일괄 제거 및 악성 제거 시나리오를 지원하도록 확장될 수 있는가?

주요 결과

  • 제안된 MUFC 프레임워크는 일곱 개의 기준 데이터셋을 통해 완전 재학습 대비 평균 84배 빠른 언리닝 성능을 달성한다.
  • MUFC는 기존 베이스라인(K-FED 및 DC-KM)보다 클러스터링 성능에서 뛰어나며, TMI 데이터셋에서 손실 비율 1.05±0.01을 기록하여 중앙집중식 K-means++에 근접한 성능을 보인다.
  • SCMA 기법은 벡터 차원에 대해 로그형 통신 복잡도를 달성하여 기존 선형 복잡도의 희소 보안 집계 방법보다 뛰어난 성능을 발휘한다.
  • 이 프레임워크는 이전 방법이 어려워하는 매우 불균형한 클러스터 크기 조건에서도 강력한 클러스터링 성능을 유지한다.
  • 이론적으로 언리닝의 복잡도가 재학습보다 훨씬 낮음을 입증하였으며, 일관된 실증적 검증도 수행하였다.
  • 저자들은 향후 페더레이티드 언리닝 연구를 지원하기 위해 TCGA의 메틸화 데이터와 장내 미생물군 데이터를 포함한 새로운 기준 데이터 컬렉션을 공개한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.