[논문 리뷰] A Fair and Efficient Hybrid Federated Learning Framework based on XGBoost for Distributed Power Prediction
이 논문은 스마트 그리드의 분산 전력 예측을 위해 XGBoost를 활용한 수평 및 수직 피어드 페더레이티드 러닝을 결합한 하이브리드 페더레이티드 러닝 프레임워크를 제안한다. 트리 기반 모델과 동적 작업 할당 기반의 통합으로 예측 정확도, 공정성 및 계산 효율성이 향상되었으며, 고정 할당 대비 훈련 시간 42% 감소 및 공정성 지수 0.609–0.739 달성.
In a modern power system, real-time data on power generation/consumption and its relevant features are stored in various distributed parties, including household meters, transformer stations and external organizations. To fully exploit the underlying patterns of these distributed data for accurate power prediction, federated learning is needed as a collaborative but privacy-preserving training scheme. However, current federated learning frameworks are polarized towards addressing either the horizontal or vertical separation of data, and tend to overlook the case where both are present. Furthermore, in mainstream horizontal federated learning frameworks, only artificial neural networks are employed to learn the data patterns, which are considered less accurate and interpretable compared to tree-based models on tabular datasets. To this end, we propose a hybrid federated learning framework based on XGBoost, for distributed power prediction from real-time external features. In addition to introducing boosted trees to improve accuracy and interpretability, we combine horizontal and vertical federated learning, to address the scenario where features are scattered in local heterogeneous parties and samples are scattered in various local districts. Moreover, we design a dynamic task allocation scheme such that each party gets a fair share of information, and the computing power of each party can be fully leveraged to boost training efficiency. A follow-up case study is presented to justify the necessity of adopting the proposed framework. The advantages of the proposed framework in fairness, efficiency and accuracy performance are also confirmed.
연구 동기 및 목표
- 전력 시스템에서 수평 및 수직 데이터 분할을 동시에 처리할 수 있는 페더레이티드 러닝 프레임워크의 격차를 해소하기 위해.
- 표본형 전력 데이터에 대해 신경망 대신 XGBoost를 사용함으로써 예측 정확도 향상 및 모델 해석 가능성 향상을 위해.
- 각 당사자의 처리 능력에 기반해 계산 부하를 공정하게 분배하는 동적 작업 할당 기반의 설계를 위해.
- 이질적인 데이터 소스를 가진 실세계 도시 전력 예측 시나리오에서 프레임워크의 성능을 평가하기 위해.
- 伝통적인 수평 및 수직 페더레이티드 러닝 대비 공정성, 효율성 및 정확도 면에서 프레임워크의 우수성을 입증하기 위해.
제안 방법
- 프레임워크는 공통된 특성을 가진 지역 간 수평 페더레이티드 러닝(수평 분할)과 공통된 샘플을 가진 당사자 간 수직 페더레이티드 러닝(수직 분할)을 통합한다.
- 표본형 데이터셋에서 높은 정확도와 해석 가능성으로 유명한 XGBoost를 기본 모델로 사용하여, 페더레이티드 환경에서 신경망의 한계를 보완한다.
- 각 지역의 계산 속도에 기반해 기울기 집합 및 노드 분할 작업을 동적으로 할당하는 작업 할당 기반의 기법을 통해 훈련 효율성을 최적화한다.
- 중앙 서버는 모든 당사자로부터 온 모델 업데이트를 안전한 집합 프로토콜을 통해 집계함으로써 데이터 프라이버시를 유지한다.
- 특성 및 샘플 이질성 모두를 지원하여, 여러 지역 및 외부 데이터 제공자 간의 협업을 가능하게 한다.
- 두 단계 훈련 프로세스를 적용한다: 첫 번째 단계에서는 각 당사자의 데이터에서 국지적 XGBoost 모델을 훈련하고, 두 번째 단계에서는 안전하고 프라이버시를 보장하는 방식으로 모델 업데이트를 집계한다.
실험 결과
연구 질문
- RQ1하이브리드 페더레이티드 러닝 프레임워크는 전력 시스템 데이터에서 수평 및 수직 데이터 분할을 효과적으로 처리할 수 있는가?
- RQ2신경망 대신 XGBoost를 사용할 경우, 페더레이티드 전력 예측에서 예측 정확도와 해석 가능성에 어떤 영향을 미치는가?
- RQ3동적 작업 할당이 이질적인 페더레이티드 러닝 환경에서 훈련 효율성과 공정성 향상에 얼마나 기여하는가?
- RQ4실세계 전력 예측 과제에서 제안된 프레임워크는 순수 수평 또는 수직 페더레이티드 러닝보다 우월한가?
- RQ5계산 이질성 하에서 동적 작업 할당에서 공정성과 효율성 간의 상충 관계는 어떠한가?
주요 결과
- 하이브리드 페더레이티드 러닝 프레임워크는 모든 테스트 방법 중 가장 높은 예측 정확도를 달성하였으며, 특히 설 연휴 및 팬데믹 기간 동안의 제10구역에서 실제 값과 매우 유사한 전력 곡선을 예측하였다.
- 고정 할당 방식 대비 훈련 시간을 42% 감소시켜, 훈련을 9,017초에 완료하였고, 고정 할당 기반 예상 시간 16,237초 대비 약 44% 단축하였다.
- 동적 작업 할당 기반의 공정성 지수는 0.609에서 0.739 사이로 나타나, 고정 할당 방식(0.1)보다 유의미하게 높은 수준의 공정성을 확보하였다.
- 더 높은 계산 능력을 지닌 지역은 더 많은 노드 분할 작업을 맡았고, 느린 지역(예: 제9구역 및 제10구역)은 노드 분할 작업에서 제외되어 병목 현상을 방지하였다.
- 동적 할당 기반의 기울기 집합 시간은 가장 느린 당사자의 시간과 동일하여 최적의 부하 균형이 달성됨을 확인하였다.
- 순수 수평 페더레이티드 러닝은 중국 모바일의 인구 이동 데이터 등 외부 특징의 누락으로 인해 정확한 예측에 실패하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.