Skip to main content
QUICK REVIEW

[논문 리뷰] Bitwidth Heterogeneous Federated Learning with Progressive Weight Dequantization

Jaehong Yoon, Geon Park|arXiv (Cornell University)|2022. 02. 23.
Privacy-Preserving Technologies in Data인용 수 5
한 줄 요약

이 논문은 계산 및 저장에 서로 다른 비트폭을 사용하는 클라이언트를 위한 Bitwidth Heterogeneous Federated Learning (BHFL) 프레임워크인 ProWD를 제안한다. ProWD는 서버에서 훈련 가능한 점진적 복소자화기(dequantizer)를 사용하여 저비트폭 클라이언트 가중치를 고정밀 표현으로 재구성하고, 선택적 집합(aggregation)을 결합하여 호환성을 향상시켜, 비트폭 이질성 하에서 CIFAR-10 및 MNIST에서 기존 방법들보다 훨씬 뛰어난 성능을 달성한다.

ABSTRACT

In practical federated learning scenarios, the participating devices may have different bitwidths for computation and memory storage by design. However, despite the progress made in device-heterogeneous federated learning scenarios, the heterogeneity in the bitwidth specifications in the hardware has been mostly overlooked. We introduce a pragmatic FL scenario with bitwidth heterogeneity across the participating devices, dubbed as Bitwidth Heterogeneous Federated Learning (BHFL). BHFL brings in a new challenge, that the aggregation of model parameters with different bitwidths could result in severe performance degeneration, especially for high-bitwidth models. To tackle this problem, we propose ProWD framework, which has a trainable weight dequantizer at the central server that progressively reconstructs the low-bitwidth weights into higher bitwidth weights, and finally into full-precision weights. ProWD further selectively aggregates the model parameters to maximize the compatibility across bit-heterogeneous weights. We validate ProWD against relevant FL baselines on the benchmark datasets, using clients with varying bitwidths. Our ProWD largely outperforms the baseline FL algorithms as well as naive approaches (e.g. grouped averaging) under the proposed BHFL scenario.

연구 동기 및 목표

  • 클라이언트가 계산 및 메모리에 서로 다른 비트폭을 사용할 경우 발생하는 모델 성능 저하 문제를 해결한다.
  • 성능 저하의 두 가지 주요 원인을 규명한다: 이질적인 비트폭 가중치를 집합함으로써 발생하는 분포 이탈(distributional shift)과 저비트폭 모델의 제한된 표현 능력.
  • 균일한 클라이언트 사양이 필요 없이 다양한 하드웨어 비트폭을 지원하는 실용적인 FL 프레임워크를 개발한다.
  • 서버에서 훈련 가능한 점진적 복소자화 기반 메커니즘을 통해 저비트폭 클라이언트 업데이트로부터 고정밀 모델 복구를 가능하게 한다.
  • 비트폭 간 호환성을 향상시키고 수렴성을 개선하기 위해 비트폭 간에 호환되는 가중치 구성 요소만 선택적으로 집합한다.

제안 방법

  • 클라이언트가 8비트, 4비트 또는 삼항(ternary)과 같이 서로 다른 비트폭을 사용하는 새로운 FL 설정인 Bitwidth Heterogeneous Federated Learning (BHFL)을 도입한다.
  • 중앙 서버에 위치한 점진적 복소자화기(progressive dequantizer)를 제안하여, 순차적 복소자화 블록을 통해 저비트폭 가중치를 고정밀 표현으로 재구성한다.
  • 비트폭 간에 호환되지 않는 저비트폭 가중치 구성 요소를 식별하고 집합 이전에 제거하는 선택적 가중치 집합 전략을 구현한다.
  • 재구성된 가중치와 전체 정밀도 가중치 간의 차이를 최소화하기 위해 재구성 손실을 사용하여 복소자화기를 종합적으로 훈련한다.
  • 업로드 및 다운로드 통신 모두에서 클라이언트별 비트폭을 사용하여 표준화 없이 이질적인 하드웨어 참여를 가능하게 한다.
  • 표준 FL 벤치마크(CIFAR-10, MNIST)에 프레임워크를 적용하여, 8비트, 4비트 및 삼항 가중치를 사용하는 클라이언트를 대상으로 성능을 평가한다.

실험 결과

연구 질문

  • RQ1균일한 하드웨어 사양이 필요 없이 다양한 비트폭을 갖는 클라이언트를 효과적으로 처리할 수 있는 피어드된 학습 시스템은 가능한가?
  • RQ2비트폭 이질성이 피어드된 학습에서 모델 수렴성과 성능에 어떤 영향을 미치는가?
  • RQ3서버에 위치한 점진적 복소자화 기반 메커니즘이 저비트폭 클라이언트 업데이트로부터 고정밀 가중치를 복구할 수 있는가?
  • RQ4가중치 구성 요소의 선택적 집합이 비트폭 이질성 있는 FL에서 호환성과 성능을 향상시키는가?
  • RQ5비트폭 이질성 하에서 ProWD는 기존의 양자화 인식 및 기준 FL 방법들과 비교해 어떻게 성능을 냅니다?

주요 결과

  • ProWD는 비트폭 이질성 하에서 CIFAR-10 및 MNIST에서 FedAvg, FedProx, FedPAQ, FedCOMGATE보다 정확도 면에서 뚜렷이 뛰어나며, 특히 고비트폭 클라이언트가 포함된 경우 성능 향상이 두드러진다.
  • 도식 6의 단계별 가중치 분포 시각화 결과에 따르면, 점진적 복소자화기가 삼항 및 저비트폭 가중치를 전체 정밀도 표현으로 성공적으로 재구성한다.
  • 도식 7의 코사인 거리 분석 결과, ProWD가 비트폭 간에 충분한 가중치 다양성을 유지하여 저비트폭 분포로의 분포 이탈을 방지함을 확인한다.
  • ProWD의 선택적 집합 전략은 호환성을 향상시켜, 비호환 가중치 구성 요소로 인한 성능 저하 위험을 줄인다.
  • 표 5 및 그림 4에 따르면, QPC 기반 방법들에 비해 ProWD는 더 나은 지식 전이와 로컬 적응을 가능하게 한다.
  • 실험 결과에 따르면, 클라이언트가 8비트, 4비트 또는 삼항 가중치를 사용할 경우에도 ProWD가 높은 성능 유지를 유지함으로써 비트폭 이질성에 대한 강건성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.