[논문 리뷰] BayBFed: Bayesian Backdoor Defense for Federated Learning
BayBFed는 데이터 분포나 공격 패tern에 대한 가정 없이 악성 업데이트를 탐지하고 필터링하는 비모수적 확률 모델링을 활용해 페더레이티드 러닝을 위한 새로운 베이지안 백도어 방어 기법을 제안한다. 계층적 베타-베르누이 프로세스와 새로운 CRP-Jensen 클러스터링 알고리즘을 통해 다양한 데이터셋에서 강건한 탐지 성능을 달성하면서도 정상 모델의 정확도를 유지한다.
Federated learning (FL) allows participants to jointly train a machine learning model without sharing their private data with others. However, FL is vulnerable to poisoning attacks such as backdoor attacks. Consequently, a variety of defenses have recently been proposed, which have primarily utilized intermediary states of the global model (i.e., logits) or distance of the local models (i.e., L2-norm) from the global model to detect malicious backdoors. However, as these approaches directly operate on client updates, their effectiveness depends on factors such as clients' data distribution or the adversary's attack strategies. In this paper, we introduce a novel and more generic backdoor defense framework, called BayBFed, which proposes to utilize probability distributions over client updates to detect malicious updates in FL: it computes a probabilistic measure over the clients' updates to keep track of any adjustments made in the updates, and uses a novel detection algorithm that can leverage this probabilistic measure to efficiently detect and filter out malicious updates. Thus, it overcomes the shortcomings of previous approaches that arise due to the direct usage of client updates; as our probabilistic measure will include all aspects of the local client training strategies. BayBFed utilizes two Bayesian Non-Parametric extensions: (i) a Hierarchical Beta-Bernoulli process to draw a probabilistic measure given the clients' updates, and (ii) an adaptation of the Chinese Restaurant Process (CRP), referred by us as CRP-Jensen, which leverages this probabilistic measure to detect and filter out malicious updates. We extensively evaluate our defense approach on five benchmark datasets: CIFAR10, Reddit, IoT intrusion detection, MNIST, and FMNIST, and show that it can effectively detect and eliminate malicious updates in FL without deteriorating the benign performance of the global model.
연구 동기 및 목표
- 기존 백도어 방어 기법이 클라이언트 모델 가중치를 직접 조작하거나 데이터 또는 공격 전략에 대한 제한적인 가정에 의존하는 데서 비롯되는 한계를 해결하기 위해.
- 데이터 이질성이나 클라이언트별 최적화 전략에 영향을 받지 않는 방식으로 로컬 훈련 전략에 의해 유도되는 모든 조정을 포괄하는 일반적인 클라이언트 업데이트 표현을 개발하기 위해.
- 업데이트의 확률적 측도를 활용해 악성 모델을 강건하게 식별하고 필터링할 수 있는 탐지 메커니즘을 설계하기 위해.
- 비정상 데이터에 대한 전역 모델 성능을 유지하면서도 다양한 이질적 및 실제 세계 데이터셋에서 표적 백도어 공격을 효과적으로 완화하기 위해.
제안 방법
- BayBFed는 계층적 베타-베르누이 프로세스를 사용해 클라이언트 모델 업데이트에 대한 확률적 측도를 계산하여, 클라이언트 간 파라미터 변화의 가능성에 대한 모델링을 수행한다.
- 중국 식당 과정에서 유도된 새로운 클러스터링 알고리즘인 CRP-Jensen을 활용해, 확률적 측도 기반으로 업데이트를 그룹화하고 이상 탐지에 활용한다.
- 방어 프레임워크는 원시 가중치가 아닌 확률적 표현을 기반으로 작동하므로, L2-노름 또는 코사인 유사도를 조작하는 공격 전략에 대해 강건하다.
- 검증 데이터가 필요로 하거나 데이터 분포, 클라이언트 레이블 다양성, 공격 시기 등에 대한 가정이 필요 없어 일반성과 유연성이 향상된다.
- BayBFed는 확률 공간에서 정상 업데이트의 주요 분포에서 크게 벗어난 클러스터를 식별함으로써 악성 업데이트를 탐지한다.
- 업데이트 집합 과정에서 의심스러운 업데이트를 필터링하여, 정상 데이터에 대한 전역 모델의 성능을 유지한다.
실험 결과
연구 질문
- RQ1원시 가중치 값에 의존하지 않고 로컬 훈련에 의해 유도되는 모든 변동을 포괄하는 클라이언트 업데이트의 확률적 표현을 구성할 수 있는가?
- RQ2그러한 확률적 측도가 다양한 데이터 분포와 공격 전략에 걸쳐 백도어 공격을 강건하게 탐지하는 데 기여할 수 있는가?
- RQ3CRP-Jensen과 같은 베이지안 비모수적 클러스터링 접근 방식이 기존의 거리 기반 또는 노름 기반 탐지 방법보다 악성 업데이트 탐지에서 뛰어난 성능을 보일 수 있는가?
- RQ4비독립 동일 분포(Non-IID) 및 실제 세계 환경에서도 표적 백도어 공격을 효과적으로 완화하면서도 높은 정상 모델 정확도를 유지할 수 있는가?
주요 결과
- BayBFed는 데이터 분포, 클라이언트 레이블 다양성, 공격 시기 등에 대한 가정 없이도 페더레이티드 러닝에서 악성 업데이트를 효과적으로 탐지하고 필터링한다.
- CIFAR10, MNIST, FMNIST, Reddit, IoT 침입 탐지 등 평가된 모든 데이터셋에서 높은 정상 모델 정확도를 유지한다.
- 기존 방어 기법을 우회하는 데 사용되는 L2-노름 또는 코사인 유사도 조작을 시도하는 고급 백도어 공격에도 저항한다.
- CRP-Jensen 클러스터링 알고리즘은 정상 업데이트 분포 내에 조용히 숨겨진 악성 업데이트도 성공적으로 식별한다.
- 실증적 평가 결과, 악성 공격자가 BayBFed를 우회하면서도 효과적인 백도어 기능을 유지하는 것은 불가능하다는 것이 확인되었다.
- 베이지안 비모수적 모델링의 활용은 다양한 페더레이티드 러닝 환경에 적용 가능한 일반적이고 강건하며 확장 가능한 방어 메커니즘을 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.