Skip to main content
QUICK REVIEW

[논문 리뷰] Federated Variance-Reduced Stochastic Gradient Descent with Robustness to Byzantine Attacks

Zhaoxian Wu, Qing Ling|arXiv (Cornell University)|2019. 12. 29.
Stochastic Gradient Optimization Techniques참고 문헌 36인용 수 15
한 줄 요약

이 논문은 Byrd-SAGA를 제안하며, 이는 SAGA를 통한 분산 최적화에서의 분산 감소와 기하 평균 집계를 조합하여 악성 기울기 공격에 강건한 분산 학습 알고리즘입니다. 확률적 기울기 노이즈를 줄임으로써 Byrd-SAGA는 악성 업데이트와 자연스러운 기울기 변동 사이의 구분을 향상시키며, 최적 해의 이웃으로 선형 수렴을 달성합니다. 이때 오차는 악성 워커 수에만 의존합니다.

ABSTRACT

This paper deals with distributed finite-sum optimization for learning over networks in the presence of malicious Byzantine attacks. To cope with such attacks, most resilient approaches so far combine stochastic gradient descent (SGD) with different robust aggregation rules. However, the sizeable SGD-induced stochastic gradient noise makes it challenging to distinguish malicious messages sent by the Byzantine attackers from noisy stochastic gradients sent by the 'honest' workers. This motivates us to reduce the variance of stochastic gradients as a means of robustifying SGD in the presence of Byzantine attacks. To this end, the present work puts forth a Byzantine attack resilient distributed (Byrd-) SAGA approach for learning tasks involving finite-sum optimization over networks. Rather than the mean employed by distributed SAGA, the novel Byrd- SAGA relies on the geometric median to aggregate the corrected stochastic gradients sent by the workers. When less than half of the workers are Byzantine attackers, the robustness of geometric median to outliers enables Byrd-SAGA to attain provably linear convergence to a neighborhood of the optimal solution, with the asymptotic learning error determined by the number of Byzantine workers. Numerical tests corroborate the robustness to various Byzantine attacks, as well as the merits of Byrd- SAGA over Byzantine attack resilient distributed SGD.

연구 동기 및 목표

  • 악성 기울기와 고분산 확률적 기울기 사이의 구분 문제를 해결한다: 분산 학습에서 악성 공격에 대한 도전에 대응한다.
  • 확률적 기울기 노이즈를 줄여 분산 최적화에서 악성 업데이트의 탐지 가능성을 향상시킨다.
  • 반드시 절반 이하의 워커가 손상된 경우에도 수렴성을 유지하는 강건한 집계 메커니즘을 개발한다.
  • 최적 해의 안정된 이웃으로 선형 수렴을 달성하며, 점차적 오차는 악성 워커 수에 의해 제한된다.
  • 여러 공격 유형에 걸쳐 표준 악성 공격에 강건한 SGD 및 미니배치 SGD와 비교해도 우수한 강건성과 효율성을 입증한다.

제안 방법

  • 분산 유한합 최적화를 위한 SAGA 알고리즘을 적응시켜, 각 워커별로 기울기 보정을 통한 분산 감소를 가능하게 한다.
  • 기존 SAGA의 평균 집계를 기하 평균 집계로 대체하여 이상치에 대한 강건성을 향상시킨다.
  • 마스터 노드가 워커들로부터 수정된 확률적 기울기를 수신하고, 이를 기하 평균으로 계산하여 모델 업데이트를 수행한다.
  • 각 워커가 과거 기울기의 로컬 메모리를 유지하여 SAGA 업데이트 규칙을 사용해 수정된 기울기를 계산하도록 보장한다.
  • 기하 평균의 이상치에 대한 강건성을 활용해, 크거나 악의적으로 설계된 악성 메시지조차도 억제한다.
  • 반드시 절반 이하의 워커가 악성일 경우, 최적 해의 이웃으로 선형 수렴을 증명한다.

실험 결과

연구 질문

  • RQ1확률적 기울기의 분산 감소가 분산 학습에서 악성 공격 탐지 가능성 향상에 기여하는가?
  • RQ2SAGA에서 평균 집계를 기하 평균 집계로 대체하면 악성 공격자에 대한 강건성이 향상되는가?
  • RQ3악성 공격에 노출된 상황에서 분산 감소 및 강건한 집계를 통한 분산 학습 알고리즘의 점차적 수렴 행동은 어떠한가?
  • RQ4이러한 시스템에서 학습 오차는 악성 워커 수에 따라 어떻게 변화하는가?
  • RQ5제안된 방법이 다양한 공격 유형에서 표준 악성 공격에 강건한 SGD보다 수렴성과 강건성 면에서 뛰어나게 성능을 발휘하는가?

주요 결과

  • Byrd-SAGA는 최적 해의 이웃으로 선형 수렴을 달성하며, 점차적 학습 오차는 악성 워커 수에 의해 결정된다.
  • 모든 정상 워커가 전체 데이터셋에 액세스할 수 있을 때 (즉, δ² = 0), Byrd-SAGA의 점차적 오차는 사라지며, 이는 악성 공격에 강건한 SGD 및 BSGD와는 다릅니다.
  • IJCNN1 데이터셋 실험에서, Byrd-SAGA가 기하 평균 집계를 사용할 경우, 가우시안, 부호 뒤집기, 영 기울기 공격 모두에서 SGD 및 BSGD를 능가했습니다.
  • 부호 뒤집기 및 영 기울기 공격 상황에서 Byrd-SAGA가 Krum 집계를 사용할 경우 최고 성능를 기록했으며, 기하 평균 집계 역시 강력한 강건성을 보였습니다.
  • MNIST 데이터셋에서 Byrd-SAGA가 기하 평균 집계를 사용할 경우, 영 기울기 공격 상황에서 92.4%의 정확도를 달성했으며, 이는 평균 집계를 사용한 SGD(26.2%) 및 BSGD(81.5%)를 크게 능가했습니다.
  • Byzantine 공격에 강건한 BSGD보다 Byrd-SAGA가 반복당 계산 비용이 낮으면서도 뛰어난 강건성과 수렴 안정성을 유지합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.