Skip to main content
QUICK REVIEW

[논문 리뷰] Privacy-Preserving Gradient Boosting Decision Trees

Qinbin Li, Zhaomin Wu|arXiv (Cornell University)|2019. 11. 11.
Privacy-Preserving Technologies in Data참고 문헌 29인용 수 8
한 줄 요약

이 논문은 기울기 기반 데이터 필터링과 기하학적 리프 클리핑을 통해 민감도 범위를 강화하고, 수준별로 나누어진 부스팅 프레임워크를 사용해 트리 간에 개인정보 보호 예산을 최적화하여 분류 정확도를 향상시키는, 차별적 비밀보장이 보장된 그래디언트 부스팅 결정트리(GBDT) 프레임워크인 DPBoost를 제안한다. 실험 결과, DPBoost는 기준 모델보다 훨씬 낮은 테스트 오차를 기록하며 강력한 개인정보 보호 보장을 유지하면서도 비공개 GBDT 모델과 경쟁 가능한 성능을 달성한다.

ABSTRACT

The Gradient Boosting Decision Tree (GBDT) is a popular machine learning model for various tasks in recent years. In this paper, we study how to improve model accuracy of GBDT while preserving the strong guarantee of differential privacy. Sensitivity and privacy budget are two key design aspects for the effectiveness of differential private models. Existing solutions for GBDT with differential privacy suffer from the significant accuracy loss due to too loose sensitivity bounds and ineffective privacy budget allocations (especially across different trees in the GBDT model). Loose sensitivity bounds lead to more noise to obtain a fixed privacy level. Ineffective privacy budget allocations worsen the accuracy loss especially when the number of trees is large. Therefore, we propose a new GBDT training algorithm that achieves tighter sensitivity bounds and more effective noise allocations. Specifically, by investigating the property of gradient and the contribution of each tree in GBDTs, we propose to adaptively control the gradients of training data for each iteration and leaf node clipping in order to tighten the sensitivity bounds. Furthermore, we design a novel boosting framework to allocate the privacy budget between trees so that the accuracy loss can be further reduced. Our experiments show that our approach can achieve much better model accuracy than other baselines.

연구 동기 및 목표

  • 민감도 범위가 느슨하고 개인정보 보호 예산 할당이 비효율적인 데 기인한 차별적 비밀보장 GBDT 모델의 정확도 저하 문제를 해결한다.
  • 엄격한 차별적 비밀보장 보장을 유지하면서도 GBDT 학습 중 모델 정확도를 향상시킨다.
  • GBDT에서 다수의 트리 간에 민감도 범위의 느슨함과 비효율적인 개인정보 보호 예산 분배라는 이중 과제를 해결한다.
  • 엄격한 개인정보 보장 조건에서도 부스팅 효과를 유지할 수 있는 확장성 있고 안정적인 학습 프레임워크를 설계한다.
  • 더 엄격한 민감도 범위와 지능적인 예산 할당 전략이 비공개 GBDT 모델과 경쟁 가능한 성능을 달성할 수 있음을 입증한다.

제안 방법

  • 각 반복 과정에서 기울기를 적응적으로 제어함으로써 손실 함수 출력의 범위를 줄이고 민감도 범위를 강화하는 기울기 기반 데이터 필터링(GDF)을 제안한다.
  • 트리 구조의 기하학적 성질을 이용해 리프 가중치를 제한함으로써 민감도 추정치를 추가로 강화하는 기하학적 리프 클리핑(GLC)을 도입한다.
  • 트리 간에 개인정보 보호 예산을 더 효과적으로 할당하기 위해 순차적 및 병렬 복합 기법을 조합한 이중 수준의 부스팅 프레임워크를 설계한다.
  • 차별적 비밀보장 하에서 최적의 분할을 선택하기 위해 지수 기반 메커니즘을 사용하며, 이때 노이즈는 강화된 민감도 범위에 기반해 조정된다.
  • 실용적인 효율성과 기존 GBDT 시스템과의 호환성을 확보하기 위해 수정된 LightGBM 파이프라인에 제안된 기법들을 통합한다.
  • 트리 단위 학습에 대한 순차 복합 및 상이한 데이터 분할에 대한 병렬 복합을 하이브리드 방식으로 적용하여 개인정보 보호 예산 사용 효율성을 극대화한다.

실험 결과

연구 질문

  • RQ1차별적 비밀보장 GBDT에서 민감도 범위를 어떻게 강화할 수 있을까? 이는 노이즈 주입을 줄이고 정확도를 향상시키는 데 기여한다.
  • RQ2차별적 비밀보장 하에서 다수 트리로 구성된 GBDT 모델의 성능에 개인정보 보호 예산 할당 전략이 미치는 영향은 어떠한가?
  • RQ3순차적 및 병렬 개인정보 보장 복합 전략을 융합한 하이브리드 복합 전략은 GBDT에서 개인정보 보호 예산 사용 효율성을 향상시킬 수 있는가?
  • RQ4차별적 비밀보장 하에서 GBDT가 비공개 GBDT 모델과 비슷한 성능을 달성할 수 있는 정도는 어느 정도인가?
  • RQ5다양한 데이터셋과 다양한 개인정보 보호 예산 조건에서 제안된 방법의 학습 시간과 안정성 측면에서의 확장성은 어떠한가?

주요 결과

  • ε = 1일 때, DPBoost는 순차 복합 기준 모델(SEQ) 대비 분류 과제에서 평균적으로 최대 10% 낮은 테스트 오차를 기록한다.
  • DPBoost는 특히 낮은 개인정보 보호 예산 조건에서 회귀 과제에서 RMSE를 크게 감소시켜 뛰어난 내구성과 정확도를 입증한다.
  • DPBoost의 테스트 오차 분산은 항상 0에 가까워 안정성이 높으며, SEQ 및 PARA와는 달리 반복 실행 간 변동이 거의 없다.
  • 5000개의 트리와 총 개인정보 보호 예산 500을 사용할 경우, DPBoost는 계속해서 테스트 오차를 감소시키지만, PARA는 약 20개 트리 이후 데이터당 트리 수가 부족해 오차가 정체된다.
  • 대부분의 경우 DPBoost의 트리당 학습 시간은 비공개 GBDT(NP)와 유사하며, 고차원 데이터셋에서는 2~3배의 느려짐만을 보이며, 모든 10개의 데이터셋에서 트리당 3초 이내로 유지된다.
  • DPBoost는 비공개 LightGBM(NP)과 매우 유사한 성능을 달성하여, 엄격한 개인정보 보장과 높은 모델 품질이 GBDT 학습에서 동시에 달성될 수 있음을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.