[논문 리뷰] FedGBF: An efficient vertical federated learning framework via gradient boosting and bagging
이 논문은 수직 분산 학습 환경에서 기울기 부스팅과 백킹을 결합하여 각 부스팅 라운드에서 병렬로 다수의 결정 트리를 훈련함으로써 훈련 시간을 크게 단축하면서도 성능를 유지하는 FedGBF라는 수직 분산 학습 프레임워크를 제안한다. 동적 버전인 Dynamic FedGBF는 하이퍼파ram터를 적응적으로 조정하여 효율성을 추가로 향상시켜, 기준 데이터셋에서 SecureBoost 대비 최대 74% 빠른 훈련을 달성하면서도 유사한 모델 정확도를 확보한다.
Federated learning, conducive to solving data privacy and security problems, has attracted increasing attention recently. However, the existing federated boosting model sequentially builds a decision tree model with the weak base learner, resulting in redundant boosting steps and high interactive communication costs. In contrast, the federated bagging model saves time by building multi-decision trees in parallel, but it suffers from performance loss. With the aim of obtaining an outstanding performance with less time cost, we propose a novel model in a vertically federated setting termed as Federated Gradient Boosting Forest (FedGBF). FedGBF simultaneously integrates the boosting and bagging's preponderance by building the decision trees in parallel as a base learner for boosting. Subsequent to FedGBF, the problem of hyperparameters tuning is rising. Then we propose the Dynamic FedGBF, which dynamically changes each forest's parameters and thus reduces the complexity. Finally, the experiments based on the benchmark datasets demonstrate the superiority of our method.
연구 동기 및 목표
- 수직 분산 학습에서 순차적 기울기 부스팅의 높은 통신 및 훈련 비용 문제를 해결하기 위해.
- 분산 백킹에서의 성능 저하를 극복하기 위해 부스팅 원리를 통합하여 모델 정확도를 향상시키기 위해.
- 분산 환경에서의 동적 하이퍼파ram터 튜닝을 통해 모델 복잡성과 중복을 감소시키기 위해.
- 최소한의 훈련 시간과 강력한 개인정보 보호 보장을 확보하면서 고성능 수직 분산 학습을 달성하기 위해.
제안 방법
- FedGBF는 각 부스팅 라운드에서 병렬로 다수의 결정 트리를 훈련하여 각 트리의 성능을 향상시키기 위해 백킹을 활용한다.
- 각 부스팅 레이어는 다수의 기본 트리 출력을 통합하여 일반화 성능를 향상시키고, 필요한 부스팅 라운드 수를 줄인다.
- Dynamic FedGBF는 각 부스팅 라운드마다 숲의 깊이, 트리 수, 샘플링 비율을 다양하게 조정하는 동적 파라미터 조정 전략을 적용한다.
- 프레임워크는 보안 집계 및 암호화된 특성 공유를 사용하여 수직 분산 학습 환경에서 참가자 간의 데이터 프라이버시를 유지한다.
- 모델 훈련은 클라이언트-서버 아키텍처에서 수행되며, 주도 파티가 트리 훈련과 집계를 조율하고, 수동 파티는 암호화된 기울기와 분할 정보를 기여한다.
- 이 방법은 순차적 및 병렬 트리 훈련을 모두 지원하며, 다양한 병렬 처리 조건 하에서 성능와 효율성이 평가된다.
실험 결과
연구 질문
- RQ1수직 분산 학습 환경에서 백킹과 기울기 부스팅을 결합함으로써 성능 손실 없이 훈련 시간을 단축시킬 수 있는가?
- RQ2분산 기울기 부스팅 환경에서 동적 하이퍼파라미터 튜닝은 모델 복잡성과 훈련 효율성에 어떤 영향을 미치는가?
- RQ3각 부스팅 레이어에서 병렬 트리 훈련이 순차적 부스팅에 비해 통신 및 계산 비용을 얼마나 줄일 수 있는가?
- RQ4실제 기준 데이터셋에서 FedGBF는 AUC, 정확도, F1 점수, 런타임 측면에서 SecureBoost와 어떻게 비교되는가?
주요 결과
- Dynamic FedGBF는 Give Me Some Credit 및 Default of Credit Card Clients 데이터셋에서 모든 테스트 부스팅 라운드 동안 SecureBoost와 유사한 AUC, 정확도 및 F1 점수를 확보했다.
- Give Me Some Credit 데이터셋에서, 트리를 병렬로 훈련할 경우 Dynamic FedGBF는 SecureBoost 대비 훈련 시간을 22%~26%로 단축시켰다.
- 최악의 순차적 훈련 상황에서도 Dynamic FedGBF는 샘플링을 줄이고 파라미터 튜닝을 최적화함으로써 SecureBoost 대비 6%~9% 더 빠른 속도를 기록했다.
- 이deal 병렬 처리 조건 하에서, Dynamic FedGBF는 SecureBoost 대비 최대 74%의 훈련 시간 단축을 달성했으며, 성능 손실는 최소한이었다.
- Dynamic FedGBF의 시간 예측 오차는 10% 이내였고, 부스팅 라운드가 증가할수록 감소하여 신뢰할 수 있는 성능 예측을 가능하게 했다.
- 암호화된 특성 교환과 보안 집계를 통해 프레임워크는 강력한 개인정보 보호 보장을 유지했으며, 데이터 공유 없이도 협업을 가능하게 했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.