Skip to main content
QUICK REVIEW

[논문 리뷰] OpBoost: A Vertical Federated Tree Boosting Framework Based on Order-Preserving Desensitization

Xiaochen Li, Yuke Hu|arXiv (Cornell University)|2022. 10. 04.
Privacy-Preserving Technologies in Data인용 수 5
한 줄 요약

OpBoost는 거리 기반 국소 미분적 비밀유지(dLDP) 하에서 순서 유지 탈식별화를 적용함으로써 기밀성과 정확도를 향상시키는 수직 분산 트리 부스팅 프레임워크이다. 이는 유틸리티 손실을 최소화하면서 상대적 특성 순서를 유지하는 세 가지 최적화된 dLDP 기반 알고리즘(Global-map, Local-map, Adj-map)을 도입하여, 전통적인 LDP 기반 방법보다 훨씬 높은 모델 정확도를 달성하면서도 낮은 계산 및 통신 오버헤드를 구현한다.

ABSTRACT

Vertical Federated Learning (FL) is a new paradigm that enables users with non-overlapping attributes of the same data samples to jointly train a model without directly sharing the raw data. Nevertheless, recent works show that it's still not sufficient to prevent privacy leakage from the training process or the trained model. This paper focuses on studying the privacy-preserving tree boosting algorithms under the vertical FL. The existing solutions based on cryptography involve heavy computation and communication overhead and are vulnerable to inference attacks. Although the solution based on Local Differential Privacy (LDP) addresses the above problems, it leads to the low accuracy of the trained model. This paper explores to improve the accuracy of the widely deployed tree boosting algorithms satisfying differential privacy under vertical FL. Specifically, we introduce a framework called OpBoost. Three order-preserving desensitization algorithms satisfying a variant of LDP called distance-based LDP (dLDP) are designed to desensitize the training data. In particular, we optimize the dLDP definition and study efficient sampling distributions to further improve the accuracy and efficiency of the proposed algorithms. The proposed algorithms provide a trade-off between the privacy of pairs with large distance and the utility of desensitized values. Comprehensive evaluations show that OpBoost has a better performance on prediction accuracy of trained models compared with existing LDP approaches on reasonable settings. Our code is open source.

연구 동기 및 목표

  • 수직 분산 트리 부스팅에서 모델 훈련 중 특성 값의 순서가 유출되는 문제를 해결하기 위해.
  • 거리에 관계없이 모든 값 쌍을 동일하게 취급하는 전통적인 국소 미분적 비밀유지(LDP) 메커니즘이 초래하는 정확도 저하 문제를 해결하기 위해.
  • 더 나은 모델 유틸리티를 확보하면서도 강력한 기밀성 보장을 보장하는 dLDP 기반 프레임워크를 설계하기 위해.
  • 수직 부스팅 시나리오에서 효율성과 정확도 향상을 위해 dLDP 정의 및 샘플링 분포를 최적화하기 위해.
  • 실제 수직 FL 구현 환경에서 기밀성, 정확도, 성능 간의 균형을 이루는 실용적이고 오픈소스 프레임워크를 제공하기 위해.

제안 방법

  • 순서형 데이터에 특화된 새로운 dLDP 변종을 제안하여, 거리에 따라 다른 불가지각 수준을 갖는 값 쌍을 허용한다.
  • 세 가지 순서 유지 탈식별화 알고리즘(Global-map, Local-map, Adj-map)을 설계하여, 기밀성-유틸리티 트레이드오프를 위한 구성 가능한 파라미터를 제공한다.
  • 특히 먼 값 쌍에 대해 비용을 줄이면서도 기밀성을 유지하기 위해 dLDP 정의를 최적화한다.
  • 표준 라플라스 노이즈에 비해 계산 오버헤드를 줄이기 위해 유한 이산 라플라스 분포를 샘플링 메커니즘으로 활용한다.
  • 도메인 특화의 특성 분포와 기밀성 예산에 맞게 조정 가능한 파라미터(α 및 θ)를 지원하여 영역에 맞는 유연한 파라미터 조정을 가능하게 한다.
  • 탈식별화 파이프라인을 수직 분산 GBDT 훈련 프레임워크에 통합하여, 강력한 기밀성 제약 하에서도 모델 성능을 유지한다.

실험 결과

연구 질문

  • RQ1dLDP는 수직 분산 학습 환경에서 트리 부스팅에 적합하게 특성 값의 순서형 구조를 효과적으로 유지할 수 있는가?
  • RQ2dLDP는 수직 FL 환경에서 강력한 기밀성 보장을 유지하면서 유틸리티 손실을 줄이기 위해 어떻게 최적화될 수 있는가?
  • RQ3다양한 탈식별화 전략(Global-map, Local-map, Adj-map)이 수직 분산 트리 부스팅에서 모델 정확도와 효율성에 미치는 영향은 어떠한가?
  • RQ4파라미터 선택(α, θ, ε)은 제안된 프레임워크에서 기밀성과 모델 유틸리티 간의 트레이드오프에 어떻게 영향을 미치는가?
  • RQ5제안된 프레임워크는 기존의 LDP 기반 및 암호 기반 수직 분산 트리 부스팅 방법보다 더 높은 정확도를 달성할 수 있는가?

주요 결과

  • OpBoost는 기존의 LDP 기반 방법에 비해 예측 정확도가 뚜렷이 높으며, 특히 낮은 기밀성 예산(예: ε < 1) 조건에서 두드러진 성능 향상을 보인다.
  • 기밀성 요구가 중간 수준일 경우 Local-map 알고리즘이 다른 탈식별화 방법에 비해 일관되게 더 높은 모델 유틸리티를 제공한다.
  • 도메인 지식이 있고 파라미터 α 및 θ를 정교하게 조정한 경우 Adj-map 알고리즘이 Global-map보다 더 높은 정확도를 달성한다.
  • 유한 이산 라플라스 분포를 사용함으로써 표준 라플라스 샘플링 대비 계산 오버헤드를 감소시켜 효율성을 향상시키면서도 기밀성을 손상시키지 않는다.
  • 프레임워크는 낮은 계산 및 통신 비용을 보이며, HE 및 MPC 기반 접근 방식에 비해 효율성에서 뛰어난 성능을 보인다.
  • 실험 결과에 따르면 대부분의 실용적 설정에서 α > 1이 충분하며, α = 10으로 설정해도 추가적인 향상이 없음을 확인하여 최적의 파라미터 범위를 제안한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.