Skip to main content
QUICK REVIEW

[논문 리뷰] A Coupled Design of Exploiting Record Similarity for Practical Vertical Federated Learning

Zhaomin Wu, Qinbin Li|arXiv (Cornell University)|2021. 06. 11.
Privacy-Preserving Technologies in Data인용 수 6
한 줄 요약

이 논문은 퍼지 식별자 간의 유사도 점수를 활용하여 일대다 레코드 연결을 모델 훈련과 융합하는 새로운 결합 훈련 프레임워크인 FedSim을 제안한다. 유사도에 따라 연결된 레코드의 기여도를 동적으로 가중하고, 훈련 과정에서 이를 조정함으로써, 퍼지 및 정확한 레코드 연결 상황 모두에서 성능을 향상시킨다. 이는 여덟 개의 데이터셋에서 최신 기술 대비 뛰어난 성능을 보이며, 개인 정보 분석과 제안된 탐욕형 추론 공격에 대한 방어 기반을 제공한다.

ABSTRACT

Federated learning is a learning paradigm to enable collaborative learning across different parties without revealing raw data. Notably, vertical federated learning (VFL), where parties share the same set of samples but only hold partial features, has a wide range of real-world applications. However, most existing studies in VFL disregard the "record linkage" process. They design algorithms either assuming the data from different parties can be exactly linked or simply linking each record with its most similar neighboring record. These approaches may fail to capture the key features from other less similar records. Moreover, such improper linkage cannot be corrected by training since existing approaches provide no feedback on linkage during training. In this paper, we design a novel coupled training paradigm, FedSim, that integrates one-to-many linkage into the training process. Besides enabling VFL in many real-world applications with fuzzy identifiers, FedSim also achieves better performance in traditional VFL tasks. Moreover, we theoretically analyze the additional privacy risk incurred by sharing similarities. Our experiments on eight datasets with various similarity metrics show that FedSim outperforms other state-of-the-art baselines. The codes of FedSim are available at https://github.com/Xtra-Computing/FedSim.

연구 동기 및 목표

  • 기존 VFL 시스템이 정확하거나 일대일 레코드 연결에 의존함으로써, 덜 유사하지만 관련성이 있는 레코드의 핵심 특징을 포착하지 못하는 한계를 해결하기 위해.
  • 레코드 연결과 훈련 과정을 분리함으로써 발생하는 성능 저하를 해결하기 위해, 모델 최적화의 피드백이 연결 품질 향상에 기여하도록 하기 위해.
  • 실생활 응용에서 흔히 나타나는 퍼지 식별자(예: 주소, GPS, 제목)를 지원하는 확장 가능한, 개인정보 인식 기반의 VFL 프레임워크를 설계하기 위해.
  • 유사도 점수 공유로 인해 발생하는 개인정보 위험을 분석하고, 공격 성공 확률에 대한 이론적 경계를 제공하는 방어 기반을 제안하기 위해.
  • 다양한 유사도 지표를 가진 다양한 데이터셋에서 최신 기술 대비 FedSim의 우월성을 입증하기 위해.

제안 방법

  • FedSim은 모델 가중치와 유사도 기반 레코드 연결 가중치를 함께 최적화하는 결합 훈련 파라다임을 도입하며, 높은 유사도를 가진 연결된 레코드를 우선시하는 유사도 인식 손실 함수를 사용한다.
  • SplitNN 아키텍처를 확장하여 보조 당사자들이 주 당사자에게 중간 표현을 전송할 수 있도록 하며, 집계 과정에서 유사도 점수를 학습 가능한 어텐션 가중치로 통합한다.
  • 프레임워크는 각 연결된 레코드의 기여도를 그 레코드가 대상과 얼마나 유사한지에 따라 동적으로 조정하며, 훈련 손실을 최소화하기 위해 반복적으로 가중치를 업데이트한다.
  • 개인정보 보호를 위해, 유사도 점수를 공유하기 전에 가우시안 노이즈를 적용하고, 미세한 개인 정보 보호 이론을 적용하여 위험을 분석하며, 강력한 보장을 제공하지 못함을 밝힌다.
  • 개인정보 위협을 테스트하기 위해 탐욕형 추론 공격을 제안하고, 이 공격의 성공 확률을 이론적 분석을 통해 경계하는 방어 기반을 도입한다.
  • 각 대상에 대해 가장 유사한 상위-K개의 레코드를 선택함으로써 일대다 연결을 지원하며, 효율성과 정보 유지 간의 균형을 확보한다.

실험 결과

연구 질문

  • RQ1유사도 기반 일대다 연결을 통합한 결합 훈련 프레임워크가 일대일 또는 일대모두 연결을 초월해 수직 연합 학습에서 성능을 향상시킬 수 있는가?
  • RQ2유사도 점수를 훈련 과정에 통합할 경우, 퍼지 식별자를 가진 VFL에서 모델 정확도와 수렴 속도에 어떤 영향을 미치는가?
  • RQ3VFL에서 유사도 점수를 공유함으로써 발생하는 개인정보 위험은 무엇이며, 이는 정량적으로 경계될 수 있는가?
  • RQ4제안된 프레임워크는 다양한 실생활 데이터셋과 다양한 유사도 지표를 가진 최신 기술 대비 기존 SOTA VFL 기반 기술을 초월할 수 있는가?
  • RQ5이 프레임워크는 다자 VFL로 확장 가능한가? 확장 가능성을 위해 어떤 가정이 필요하는가?

주요 결과

  • FedSim은 주택 가격 예측 및 게임 추천과 같은 실생활 응용을 포함한 여덟 개의 데이터셋에서 최신 기술 대비 뛰어난 성능을 보이며, 정확도 향상이 일관되게 관찰된다.
  • GPS 위치나 게임 제목과 같은 퍼지 식별자가 있는 상황에서 기존의 일대일 연결 방식이 관련 특징을 포착하지 못하는 데서 FedSim은 뚜렷한 성능 향상을 달성한다.
  • 정확한 식별자가 포함된 데이터셋에서는 기존 기반 기술과 유사한 성능를 유지하지만, K 값이 너무 클 경우 성능 저하가 발생할 수 있어 하이퍼파rameter 선택에 민감함을 보인다.
  • 제안된 탐욕형 공격은 유사도 점수에서 식별자를 비밀리에 추론할 수 있는 비용이 들지 않는 확률을 가짐을 입증하며, 유사도 공유 시스템에서 개인정보 보호의 필요성을 확인한다.
  • 이론적 분석을 통해 탐욕형 공격의 성공 확률을 경계하였으며, 방어 기반은 현실적인 가정 하에 성공적인 추론 확률을 효과적으로 감소시킨다.
  • 주 당사자가 더 유용한 특징을 보유하는 가정 하에 FedSim은 다자 VFL로 확장 가능하며, 보조 당사자들에게 일대일 연결을 제공함으로써 성능 저하 없이 기능한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.