[논문 리뷰] A Vertical Federated Learning Framework for Horizontally Partitioned Labels
이 논문은 수직 분할된 레이블(모든 당사자가 레이블을 모두 보유하지 않는 경우)에서 개인정보 보호를 위한 딥 뉴럴 네트워크 훈련을 가능하게 하는 새로운 프레임워크인 캐스케이드 수직联邦학습(CVFL)을 제안한다. 이는 계단식 집계 메커니즘과 새로운 최적화 목표를 활용하여, 자원 제약 조건에서의 느린 참여자 문제를 크게 완화하고, 중심 집합 훈련과 유사한 성능을 달성한다.
Vertical federated learning is a collaborative machine learning framework to train deep leaning models on vertically partitioned data with privacy-preservation. It attracts much attention both from academia and industry. Unfortunately, applying most existing vertical federated learning methods in real-world applications still faces two daunting challenges. First, most existing vertical federated learning methods have a strong assumption that at least one party holds the complete set of labels of all data samples, while this assumption is not satisfied in many practical scenarios, where labels are horizontally partitioned and the parties only hold partial labels. Existing vertical federated learning methods can only utilize partial labels, which may lead to inadequate model update in end-to-end backpropagation. Second, computational and communication resources vary in parties. Some parties with limited computational and communication resources will become the stragglers and slow down the convergence of training. Such straggler problem will be exaggerated in the scenarios of horizontally partitioned labels in vertical federated learning. To address these challenges, we propose a novel vertical federated learning framework named Cascade Vertical Federated Learning (CVFL) to fully utilize all horizontally partitioned labels to train neural networks with privacy-preservation. To mitigate the straggler problem, we design a novel optimization objective which can increase straggler's contribution to the trained models. We conduct a series of qualitative experiments to rigorously verify the effectiveness of CVFL. It is demonstrated that CVFL can achieve comparable performance (e.g., accuracy for classification tasks) with centralized training. The new optimization objective can further mitigate the straggler problem comparing with only using the asynchronous aggregation mechanism during training.
연구 동기 및 목표
- 기존 수직 연합학습 방법이 최소한의 당사자가 모든 레이블을 보유해야 한다는 제약 조건을 해결하고자 하며, 이는 실세계 상황에서 자주 실현 불가능하다.
- 레이블이 수직 분할되어 있을 경우 종단 간 역전파에서 레이블의 부분적 활용으로 인한 성능 저하 문제를 해결하고자 한다.
- 당사자 간 계산 및 통신 자원이 이질적인 상황에서 수직 연합학습의 느린 참여자 문제를 완화하고자 한다.
- 모든 당사자에서 이용 가능한 레이블을 완전히 활용하면서도 데이터 프라이버시를 유지하는 훈련 프레임워크를 설계하고자 한다.
제안 방법
- 모든 당사자가 전역 레이블을 확보할 필요 없이, 각 당사자가 자체적으로 확보한 레이블만으로도 모델 업데이트에 기여할 수 있도록 하는 계단식 집계 메커니즘을 도입한다.
- 지역 데이터 품질과 가용성에 따라 동적으로 기울기 업데이트를 조정함으로써 느린 참여자 당사자의 기여도를 높이는 새로운 최적화 목표를 제안한다.
- 특성 수준의 데이터 정렬과 안전한 집계를 사용하여 당사자들이 공동으로 공유된 딥 뉴럴 네트워크를 훈련하는 수직 연합학습 아키텍처를 구현한다.
- 원시 데이터와 레이블이 당사자 간에 공유되지 않도록 보장하기 위해 안전한 집계 프로토콜을 사용하여 프라이버시를 유지한다.
- 지역 모델 업데이트와 글로벌 모델 집계를 번갈아 수행하는 훈련 파이프라인을 설계하며, 느린 참여자 고려 최적화를 통해 수렴을 향상시킨다.
- 비동기 집계와 적응형 가중치를 사용하여 계산 자원이 낮거나 느린 당사자들이 전체 훈련 속도와 정확도에 미치는 영향을 최소화한다.
실험 결과
연구 질문
- RQ1레이블이 당사자 간에 수직 분할되어 있을 경우, 어떤 당사자도 모든 레이블을 보유하지 않더라도 수직 연합학습 프레임워크가 딥 뉴럴 네트워크를 효과적으로 훈련시킬 수 있는가?
- RQ2당사자 간 계산 및 통신 능력이 상이할 경우 수직 연합학습에서 느린 참여자 문제를 어떻게 완화할 수 있는가?
- RQ3부분적인 레이블 커버리지가 존재하는 연합학습 환경에서, 저자원 또는 느린 당사자의 기여도를 향상시킬 수 있는 최적화 목표는 무엇인가?
- RQ4수평 레이블 분할 조건 하에서 개인정보 보호를 위한 연합학습 프레임워크가 중심 집합 훈련 수준의 성능을 얼마나 잘 달성할 수 있는가?
주요 결과
- CVFL은 중심 집합 훈련과 유사한 분류 정확도를 달성하여, 수평 레이블 분할 조건에서도 모든 당사자에서 확보 가능한 레이블을 완전히 활용함으로써 고성능 모델 학습이 가능하다는 점을 입증한다.
- 제안된 최적화 목표는 비동기 집계만을 사용하는 경우에 비해 수렴 속도와 모델 정확도를 크게 향상시키며, 특히 느린 참여자가 존재할 경우에 두드러진다.
- 적응형 기울기 가중치를 통해 저자원 당사자의 효과적 기여도를 높임으로써 프레임워크가 느린 참여자 문제를 효과적으로 완화한다.
- 실증 결과에 따르면, 일부 당사자가 계산 또는 통신 자원이 제한된 경우에도 CVFL은 동일 조건에서 기준 모델보다 뛰어난 성능을 유지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.