Skip to main content
QUICK REVIEW

[논문 리뷰] Vertical federated learning based on DFP and BFGS

Wenjie Song, Xuan Shen|arXiv (Cornell University)|2021. 01. 23.
Privacy-Preserving Technologies in Data참고 문헌 13인용 수 5
한 줄 요약

이 논문은 로지스틱 회귀에서 수렴성 향상과 통신 라운드 수 감소를 위해 DFP와 BFGS 준뉴턴 방법을 융합한 새로운 수직 연합 학습 프레임워크인 BDFL을 제안한다. 보안 집계를 활용한 2차 최적화를 통해 BDFL은 SGD 및 독립적인 DFP/BFGS보다 더 높은 모델 정확도와 더 빠른 수렴성을 달성하며, 비독립 동일 분포(non-iid) 데이터와 기밀성 제약 조건 하에서도 특히 유리하다.

ABSTRACT

As data privacy is gradually valued by people, federated learning(FL) has emerged because of its potential to protect data. FL uses homomorphic encryption and differential privacy encryption on the promise of ensuring data security to realize distributed machine learning by exchanging encrypted information between different data providers. However, there are still many problems in FL, such as the communication efficiency between the client and the server and the data is non-iid. In order to solve the two problems mentioned above, we propose a novel vertical federated learning framework based on the DFP and the BFGS(denoted as BDFL), then apply it to logistic regression. Finally, we perform experiments using real datasets to test efficiency of BDFL framework.

연구 동기 및 목표

  • 수직 연합 학습에서 SGD와 같은 1차 최적화 방법의 높은 통신 비용과 느린 수렴성 문제를 해결한다.
  • 기존 준뉴턴 방법(예: BFGS)이 비독립 동일 분포 데이터 환경과 통신 효율성에서 가지는 한계를 극복한다.
  • 원시 데이터를 공유하지 않고도 협업 모델 학습이 가능한 보안적이고 기밀성을 보장하는 프레임워크를 개발한다.
  • 수직 FL을 위한 통합 최적화 프레임워크에 DFP와 BFGS를 융합하여 모델 정확도와 수렴 속도를 향상시킨다.
  • 엄격한 데이터 기밀성 제약 조건 하에서 실제 데이터셋에 대해 제안된 BDFL 프레임워크의 효과성을 입증한다.

제안 방법

  • DFP와 BFGS 준뉴턴 방법을 융합하여 최적화 효율성을 향상시킨 새로운 수직 연합 학습 프레임워크인 BDFL을 제안한다.
  • 암호화된 기울기 교환을 가능하게 하기 위해 동형 암호화를 활용한 보안 다자간 계산(MPC)을 사용한다.
  • 각 당사자에 대해 별도의 헤시안 근사값 $ C_k^A $ 와 $ C_k^B $ 를 유지하며, Broyden–Fletcher–Goldfarb–Shanno (BFGS) 및 David–Fletcher–Powell (DFP) 업데이트 규칙을 반복적으로 적용하여 업데이트한다.
  • 준뉴턴 업데이트 식을 사용하여 파라미터를 업데이트한다: $ \boldsymbol{w}^{k+1} = \boldsymbol{w}^k - \alpha_k C_k \nabla \ell(\boldsymbol{w}^k) $, 여기서 $ C_k $ 는 통합된 헤시안 근사값이다.
  • 기울기가 암호화되어 중앙 서버(당사자 C)로 전송되어 복호화 및 집계되며, 이 과정에서 데이터 기밀성이 유지되는 보안 집계 프로토콜을 도입한다.
  • 학습률 감소와 라운드별 수렴 검사를 적용하여 안정적인 학습과 조기 종료를 보장한다.

실험 결과

연구 질문

  • RQ1DFP와 BFGS를 수직 연합 학습 프레임워크에 융합함으로써 통신 횟수를 줄이면서도 모델 정확도를 유지하거나 향상시킬 수 있는가?
  • RQ2비독립 동일 분포 데이터 분포 하에서 제안된 BDFL 프레임워크는 SGD 및 독립적인 BFGS/DFP와 비교해 어떻게 성능을 내는가?
  • RQ3BDFL 프레임워크는 데이터 사일로 간 효과적인 모델 학습을 가능하게 하면서도 어느 정도의 데이터 기밀성을 유지하는가?
  • RQ4수직 FL에서 2차 최적화를 사용할 경우 1차 최적화 방법보다 더 빠른 수렴성과 더 나은 일반화 성능을 달성하는가?
  • RQ5보안 기반 기울기 집계는 학습 과정의 확장성과 내구성에 어떤 영향을 미치는가?

주요 결과

  • 신용카드 데이터셋에서 BDFL은 테스트 정확도 91.35%를 달성하여 SGD(90.90%)와 BCGS(95.10%)를 모두 앞서며, 통신 오버헤드를 줄이면서도 BFGS 수준의 성능를 유지했다.
  • 유방암 데이터셋에서 BDFL은 테스트 정확도 91.35%를 기록하여 BFGS(91.29%)를 약간 상회했으며, DFP(85.57%)와 SGD(86.26%)에 비해 뚜렷한 우월성을 보였다.
  • 학습 손실 곡선을 분석한 결과, BDFL은 DFP와 BFGS보다 빠르게 수렴했으며, 특히 초기 학습 단계에서 SGD보다 뚜렷한 수렴 속도 향상을 보였다.
  • BDFL은 SGD 및 독립적인 준뉴턴 방법에 비해 수렴에 필요한 통신 횟수를 줄여 통신 효율성이 향상됨을 입증했다.
  • 원시 데이터가 공유되지 않도록 보장하여 데이터 기밀성이 유지되며, 오직 암호화된 기울기와 중간 값만 당사자 간에 교환된다.
  • 향상된 수렴성과 정확도에도 불구하고 모델의 계산 비용은 여전히 높으며, 예상보다 수렴 속도가 빨라지지 않아 향후 연구에서 최적화 여지가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.