[논문 리뷰] RFLBAT: A Robust Federated Learning Algorithm against Backdoor Attack
RFLBAT는 공격자 수나 데이터 분포에 대한 사전 지식 없이 PCA와 K-means 클러스터링을 사용하여 악성 기울기를 탐지하고 제외함으로써 뒷통수 공격에 대비하는 새로운 강건한 분산 학습 알고리즘입니다. 비균일 데이터 분포, 다양한 수의 클라이언트, 분산된 뒷통수 공격과 같은 다양한 공격 시나리오에서 최신 기법들을 능가합니다. 특히 악성 클라이언트가 우세한 경우에도 성능을 유지를 합니다.
Federated learning (FL) is a distributed machine learning paradigm where enormous scattered clients (e.g. mobile devices or IoT devices) collaboratively train a model under the orchestration of a central server (e.g. service provider), while keeping the training data decentralized. Unfortunately, FL is susceptible to a variety of attacks, including backdoor attack, which is made substantially worse in the presence of malicious attackers. Most of algorithms usually assume that the malicious at tackers no more than benign clients or the data distribution is independent identically distribution (IID). However, no one knows the number of malicious attackers and the data distribution is usually non identically distribution (Non-IID). In this paper, we propose RFLBAT which utilizes principal component analysis (PCA) technique and Kmeans clustering algorithm to defend against backdoor attack. Our algorithm RFLBAT does not bound the number of backdoored attackers and the data distribution, and requires no auxiliary information outside of the learning process. We conduct extensive experiments including a variety of backdoor attack types. Experimental results demonstrate that RFLBAT outperforms the existing state-of-the-art algorithms and is able to resist various backdoor attack scenarios including different number of attackers (DNA), different Non-IID scenarios (DNS), different number of clients (DNC) and distributed backdoor attack (DBA).
연구 동기 및 목표
- 공격자 수와 데이터 비균일성(non-IID)이 알려지지 않은 현실적인 조건에서 분산 학습의 뒷통수 공격에 대한 임계적인 취약성을 해결합니다.
- 악성 클라이언트 수가 양호 클라이언트 수 이하이거나 데이터 분포가 IID라고 가정하는 기존 강건한 집계 방법의 한계를 극복합니다.
- 학습 또는 테스트 데이터에 접근할 수 없더라도 백도ored 모델 업데이트를 탐지하고 제외할 수 있는 방어 메커니즘을 개발하여 개인정보 보호를 보장합니다.
- 악성 클라이언트가 학습 과정을 지배하거나 공격이 여러 클라이언트에 걸쳐 분산되는 극단적인 상황에서도 강건성을 확보합니다.
- PCA와 클러스터링을 활용해 기울기의 구조를 기반으로 양호한 업데이트와 오염된 업데이트를 구분하는 확장 가능한 비지도 기반 방어를 제공합니다.
제안 방법
- 클라이언트 모델 업데이트의 차원을 줄이기 위해 주성분 분석(PCA)을 적용하여 기저의 기울기 구조를 드러내어, 양호한 기울기와 백도ored 기울기 간의 명확한 분리를 가능하게 합니다.
- PCA로 감소된 기울기 위에 K-means 클러스터링을 적용하여 유사한 업데이트를 그룹화하며, 여기서 양호한 기울기는 자연스럽게 조밀한 클러스터를 형성하고, 백도ored 기울기는 독립된 이질적 군집이 됩니다.
- 기울기 벡터 간 코사인 유사도를 활용해 전역 모델 집계에 가장 적합한 양호한 기울기들을 식별하고 선택합니다.
- 선택된 양호한 기울기들만 가중 평균을 사용하여 집계하여 업데이트된 전역 모델을 구성함으로써 악성 업데이트를 효과적으로 배제합니다.
- 공격 강도의 변화에 대응하기 위해 PCA의 스케일 인자를 동적으로 조정하여, 양호한 기울기와 백도ored 기울기 간의 분리 가능성을 향상시킵니다.
- 완전히 비지도 방식으로 운영됩니다. 레이블 데이터가 필요 없으며, 보조 모델이나 공격자 수 또는 데이터 분포에 대한 가정도 필요 없습니다.
실험 결과
연구 질문
- RQ1기존에 악성 클라이언트 수를 알지 못하는 조건에서 강건한 집계 알고리즘이 백도ored 기울기를 탐지하고 제외할 수 있을까요?
- RQ2기존 기법들이 종종 실패하는 비균일 데이터 분포(non-IID) 조건에서 RFLBAT의 뒷통수 공격 방어 효과는 어떠한가요?
- RQ3참여 클라이언트 수나 공격자 수가 크게 변할 경우 RFLBAT는 높은 모델 정확도와 강건성을 유지할 수 있을까요?
- RQ4여러 클라이언트가 서로 다른 데이터 서브셋에 걸쳐 트리거를 함께 삽입하는 분산 뒷통수 공격에 대해 RFLBAT의 성능은 어떠한가요?
- RQ5대부분의 이전 방어 기법들이 그 기반 가정에 따라 실패하는 상황인 악성 클라이언트 수가 양호 클라이언트 수를 초과하는 경우에도 RFLBAT는 효과를 유지할 수 있을까요?
주요 결과
- RFLBAT는 평가된 모든 뒷통수 공격 시나리오에서 최신 기법들을 뛰어넘는 유의미하게 높은 테스트 정확도를 달성합니다. 이는 공격자 수 다양성(DNA), 비균일 데이터 분포(DNS), 클라이언트 수 다양성(DNC), 분산 뒷통수 공격(DBA) 등 다양한 조건을 포함합니다.
- 분산 뒷통수 공격(DBA) 시나리오에서, RFLBAT는 백도어 클라이언트가 기울기를 강화하는 경우에도 높은 성능을 유지하여 기울기 조작에 대한 내성을 입증합니다.
- PCA로 감소된 기울기의 시각화 결과, 스케일 인자 λ=100일 때, 양호한 기울기와 백도ored 기울기가 명확히 별도의 클러스터로 분리되어 정확한 탐지 및 제거가 가능합니다.
- λ=1일 경우 기울기가 너무 산산이 흩어져 있어 신뢰할 수 있는 클러스터링이 어려워 일부 양호한 기울기가 제외되는 경우가 발생하지만, λ=100일 경우 모든 양호한 기울기가 단일 클러스터에 성공적으로 포착됩니다.
- Krum, Bulyan, FoolsGold와 같은 기존 기법들보다 RFLBAT는 정확도와 강건성 면에서 뛰어나며, 특히 고공격률 및 비균일 데이터 설정에서 두각을 나타냅니다.
- 악성 클라이언트 수가 양호 클라이언트 수를 초과하는 경우에도 대부분의 이전 방어 기법들이 그 기반 가정에 의해 실패하는 상황에서 RFLBAT는 효과성을 유지합니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.