Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Federated Learning with Connectivity Failures: A Semi-Decentralized Framework with Collaborative Relaying

Michal Yemini, Rajarshi Saha|arXiv (Cornell University)|2022. 02. 24.
Cooperative Communication and Network Coding인용 수 8
한 줄 요약

이 논문은 클라이언트가 서로의 모델 업데이트를 중앙 매개변수 서버로 협동적으로 릴레이할 수 있도록 허용하는 반분산형 페더레이티드 러닝 프레임워크를 제안한다. 이는 간헐적인 연결성으로 인한 성능 저하를 완화한다. 국소 공감 가중치를 최적화하여 편향이 없고 분산이 최소인 전역 업데이트를 보장함으로써, 차단이 자주 발생하는 무선 환경에서 수렴성을 크게 향상시킨다. mmWave 조건 하에서 CIFAR-10에서 검증된 바 있다.

ABSTRACT

Intermittent connectivity of clients to the parameter server (PS) is a major bottleneck in federated edge learning frameworks. The lack of constant connectivity induces a large generalization gap, especially when the local data distribution amongst clients exhibits heterogeneity. To overcome intermittent communication outages between clients and the central PS, we introduce the concept of collaborative relaying wherein the participating clients relay their neighbors' local updates to the PS in order to boost the participation of clients with poor connectivity to the PS. We propose a semi-decentralized federated learning framework in which at every communication round, each client initially computes a local consensus of a subset of its neighboring clients' updates, and eventually transmits to the PS a weighted average of its own update and those of its neighbors'. We appropriately optimize these local consensus weights to ensure that the global update at the PS is unbiased with minimal variance - consequently improving the convergence rate. Numerical evaluations on the CIFAR-10 dataset demonstrate that our collaborative relaying approach outperforms federated averaging-based benchmarks for learning over intermittently-connected networks such as when the clients communicate over millimeter wave channels with intermittent blockages.

연구 동기 및 목표

  • 직접적인 클라이언트-서버 연결이 간헐적으로 차단되는 상황에서 발생하는 페더레이티드 러닝의 성능 저하 문제를 해결하기 위해.
  • 클라이언트가 직접 통신 링크를 잃는 스트래글러가 많은 환경에서 전통적인 페더링 평균의 한계를 극복하기 위해.
  • 클라이언트 간 협업을 통해 업데이트를 릴레이함으로써, 연결성 실패에도 불구하고 지속적인 참여를 보장하는 강건한 학습 프레임워크를 설계하기 위해.
  • 최적화된 국소 공감 가중치를 통해 편향이 없고 분산이 최소인 전역 업데이트를 이론적으로 보장하기 위해.
  • 실제 무선 엣지 학습 시나리오, 예를 들어 mmWave 및 이동 로봇 네트워크와 같은 환경에서 수렴성과 일반화 성능 향상을 입증하기 위해.

제안 방법

  • 각 클라이언트가 자신의 이웃 클라이언트들의 업데이트를 국소적으로 공감한 후 중앙 매개변수 서버로 전달하는 반분산형 FL 프레임워크를 도입한다.
  • 각 클라이언트는 자신의 업데이트와 연결된 이웃들의 업데이트를 가중 평균으로 전송하며, 이 가중치는 분산을 최소화하고 약한 편향 없음을 보장하기 위해 최적화된다.
  • 신뢰성과 수렴 속도의 균형을 맞추기 위해 콘벡스 최적화 설정을 사용하여 최적의 릴레이 가중치를 계산한다.
  • 총 가중치 합에 대한 제약 조건 하에서 가중치 선택 문제를 해결하기 위해 Karush–Kuhn–Tucker 조건을 적용한다.
  • 클라이언트 간 통신을 확률적 링크로 모델링한 그래프로 네트워크를 표현하며, 전송 성공 확률을 통해 신뢰성을 캡처한다.
  • 링크 신뢰도를 모델링하고 최적화 目적 함수에 기대값을 사용함으로써 채널 차단 영향을 수학적으로 반영한다.

실험 결과

연구 질문

  • RQ1직접적인 서버 연결이 간헐적으로 차단될 경우, 클라이언트 수준의 협업이 페더레이티드 러닝 수렴성에 어떻게 기여할 수 있는가?
  • RQ2전역 모델 업데이트가 편향 없고 분산이 최소가 되도록 보장하기 위해, 클라이언트 자신의 업데이트와 이웃들의 업데이트를 어떻게 가중해야 하는가?
  • RQ3mmWave 시스템과 같이 높은 차단률을 보이는 무선 네트워크에서, 협동 릴레이가 표준 페더링 평균보다 뛰어난 성능을 보일 수 있는가?
  • RQ4동적이고 불안정한 연결성 조건 하에서도 제안된 반분산형 프레임워크가 수렴 보장을 유지할 수 있는가?
  • RQ5릴레이 가중치를 최적화함으로써 비-iid 및 스트래글러가 많은 페더레이티드 러닝 환경에서 일반화 갭에 이론적으로 어떤 영향을 미치는가?

주요 결과

  • 제안된 협동 릴레이 프레임워크는 특히 mmWave 차단 조건에서 간헐적인 연결 네트워크에서 표준 페더링 평균보다 훨씬 더 빠른 수렴성을 달성한다.
  • 릴레이 가중치 최적화를 통해 전역 업데이트의 약한 편향 없음을 보장하여 학습 알고리즘의 수렴성을 유지한다.
  • 연결성이 열악한 클라이언트로부터 오래된 또는 누락된 업데이트로 인한 일반화 갭을 줄인다.
  • CIFAR-10에서의 수치적 평가 결과, 간헐적인 연결성 하에서도 테스트 정확도와 수렴 속도 측면에서 벤치마크를 능가하는 성능을 보였다.
  • 이론적 분석을 통해 목적 함수가 릴레이 가중치에 대해 콘벡스임을 확인하였으며, KKT 조건을 통해 효율적이고 안정적인 최적화가 가능함을 입증하였다.
  • 기본 학습 알고리즘의 변경 없이도, 중앙 집중적 조율 없이도 통신 스트래글러의 영향을 효과적으로 완화한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.