Skip to main content
QUICK REVIEW

[논문 리뷰] Label Leakage and Protection from Forward Embedding in Vertical Federated Learning

Jiankai Sun, Xin Yang|arXiv (Cornell University)|2022. 03. 02.
Privacy-Preserving Technologies in Data인용 수 11
한 줄 요약

이 논문은 수직联邦 학습(vFL)에서 순방향 중간 임베딩을 통한 레이블 泄露를 규명하고 이를 완화한다. 기존의 기울기 기반 보호 조치가 있음에도 불구하고 비밀 레이블을 유추할 수 있는 스펙트럼 공격을 제안한다. 레이블 당사자에서 임베딩과 레이블 간의 거리 상관계수를 최소화하는 방식의 방어 기법을 도입하여 공격 AUC를 약 0.5로 낮추면서도 모델 성능을 유지한다.

ABSTRACT

Vertical federated learning (vFL) has gained much attention and been deployed to solve machine learning problems with data privacy concerns in recent years. However, some recent work demonstrated that vFL is vulnerable to privacy leakage even though only the forward intermediate embedding (rather than raw features) and backpropagated gradients (rather than raw labels) are communicated between the involved participants. As the raw labels often contain highly sensitive information, some recent work has been proposed to prevent the label leakage from the backpropagated gradients effectively in vFL. However, these work only identified and defended the threat of label leakage from the backpropagated gradients. None of these work has paid attention to the problem of label leakage from the intermediate embedding. In this paper, we propose a practical label inference method which can steal private labels effectively from the shared intermediate embedding even though some existing protection methods such as label differential privacy and gradients perturbation are applied. The effectiveness of the label attack is inseparable from the correlation between the intermediate embedding and corresponding private labels. To mitigate the issue of label leakage from the forward embedding, we add an additional optimization goal at the label party to limit the label stealing ability of the adversary by minimizing the distance correlation between the intermediate embedding and corresponding private labels. We conducted massive experiments to demonstrate the effectiveness of our proposed protection methods.

연구 동기 및 목표

  • 기존의 기울기 기반 보호 조치가 있음에도 불구하고 vFL의 중간 임베딩에서 비밀 레이블이 泄露될 수 있음을 규명하는 것.
  • 레이블 차별적 개인정보 보호와 기울기 흐림 처리가 적용된 상황에서도 스펙트럼 공격을 통해 순방향 임베딩에서 레이블을 유추할 수 있음을 입증하는 것.
  • 레이블 당사자에서 컷-레이어 임베딩과 비밀 레이블 간의 거리 상관계수를 최소화하는 새로운 방어 기법을 제안하는 것.
  • 기존의 기울기 기반 개인정보 보호 방법과의 효과성 및 호환성을 평가하는 것.

제안 방법

  • 이중 당사자 vFL 환경에서 공유된 순방향 중간 임베딩에서 비밀 레이블을 유추하기 위한 스펙트럼 공격 방법을 제안한다.
  • 컷-레이어 임베딩과 해당 비밀 레이블 간의 거리 상관계수를 최소화하기 위해 레이블 당사자에서 추가 최적화 목표를 도입한다.
  • 임베딩과 레이블 간의 통계적 의존도를 측정하고 감소시키기 위해 거리 상관계수를 미분 가능한 측정치로 사용한다.
  • 정규화 항의 강도를 조절하기 위해 하이퍼파rameter αd를 사용하며, 이는 개인정보 보호와 모델 성능 간의 균형을 맞춘다.
  • Marvell(기울기 흐림 처리) 및 Label DP와 같은 기존 방어 기법과의 호환성을 검증하기 위해 제안된 방법과 병합하여 실험한다.
  • 실세계 데이터셋을 대상으로 광범위한 실험을 수행하여 공격 성공률과 방어 기법의 효용성을 평가한다.

실험 결과

연구 질문

  • RQ1기울기 기반 보호 조치가 적용된 상황에서도 vFL의 순방향 중간 임베딩에서 비밀 레이블을 효과적으로 유추할 수 있는가?
  • RQ2중간 임베딩과 비밀 레이블 간의 상관계수가 레이블 泄露를 가능하게 하는 역할은 무엇인가?
  • RQ3모델 성능 저하 없이 레이블 당사자가 순방향 임베딩에서의 레이블 泄露 위험을 어떻게 최소화할 수 있는가?
  • RQ4제안된 방어 기법은 기존의 기울기 기반 개인정보 보호 메커니즘과 효과적으로 조합될 수 있는가?
  • RQ5다양한 수준의 정규화에서 개인정보 보호와 모델 성능 간의 상호 교환 관계는 어떠한가?

주요 결과

  • 스펙트럼 공격은 보호 조치가 없는 임베딩에서 거의 1.0에 가까운 레이블 유추 AUC를 기록하여 비밀 레이블을 도용하는 데 매우 효과적임을 입증한다.
  • αd = 0.002일 때 제안된 방어 기법은 공격 AUC를 약 0.5(무작위 추측 수준)로 낮추어 강력한 개인정보 보호 효과를 보인다.
  • αd = 0.002일 때 테스트 AUC로 측정한 모델 성능은 원본 모델과 약 0.01 이내로 거의 변화가 없어 성능 저하가 최소화됨을 보여준다.
  • Marvell과 같은 기울기 흐림 처리 방법과의 호환성이 확인되어 순방향 임베딩과 기울기 기반 레이블 泄露에 동시에 대응할 수 있다.
  • 민감도 분석 결과, αd ∈ [0.002, 0.005] 범위에서 개인정보 보호(AUC ≈ 0.5)와 모델 성능(테스트 AUC 거의 변화 없음) 간의 좋은 균형을 확보할 수 있음이 확인되었다.
  • 개인정보 보호의 비용은 레이블 당사자에서 상관계수를 감소시키기 위해 재학습이 필요해지므로 계산 부담이 증가하지만, 이는 관리 가능한 수준이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.