[논문 리뷰] Secure Federated Learning against Model Poisoning Attacks via Client Filtering
이 논문은 코사인 유사도를 기반으로 하부 모델의 마지막 레이어 가중치와 각 클라이언트의 로컬 업데이트 간의 유사도를 계산하여 악성 업데이트를 탐지하고 제외하는 클라이언트 필터링 방식인 CosDefense를 제안한다. 검증 데이터, 공격자 수 추정치, 이전 클라이언트 기록이 필요 없이도 MNIST에서 83.37%의 정확도를 달성하며, 클라이언트 샘플링과 호환되며 데이터 이질성에 강건한 성능을 보인다.
Given the distributed nature, detecting and defending against the backdoor attack under federated learning (FL) systems is challenging. In this paper, we observe that the cosine similarity of the last layer's weight between the global model and each local update could be used effectively as an indicator of malicious model updates. Therefore, we propose CosDefense, a cosine-similarity-based attacker detection algorithm. Specifically, under CosDefense, the server calculates the cosine similarity score of the last layer's weight between the global model and each client update, labels malicious clients whose score is much higher than the average, and filters them out of the model aggregation in each round. Compared to existing defense schemes, CosDefense does not require any extra information besides the received model updates to operate and is compatible with client sampling. Experiment results on three real-world datasets demonstrate that CosDefense could provide robust performance under the state-of-the-art FL poisoning attack.
연구 동기 및 목표
- 서버가 원시 클라이언트 데이터에 접근할 수 없음에도 불구하고 분산 학습에서 모델 오염 공격을 탐지하고 방어하는 데 도전하는 것.
- 검증 데이터, 이전 클라이언트 기록, 정확한 공격자 수 추정치가 필요한 기존 방어 기법의 한계를 극복하는 것.
- 모델 업데이트만을 기반으로 작동하며 클라이언트 샘플링과 호환되는 경량의 서버 측 방어를 개발하는 것.
- 실제 분산 학습 환경에서의 데이터 이질성과 비아이디얼 데이터 분할에 대한 강건성을 향상시키는 것.
- 복잡한 가정이나 추가 인프라에 의존하지 않는 실용적이고 구현 가능한 방어 메커니즘을 제공하는 것.
제안 방법
- 방법은 글로벌 모델의 마지막 레이어 가중치와 각 클라이언트의 로컬 업데이트 간의 코사인 유사도를 계산하여 이상치를 탐지한다.
- 평균보다 유사도 점수가 현저히 높은 클라이언트는 악성일 가능성이 있다고 경고한다.
- 해당 라운드에서 모든 클라이언트의 유사도 점수 평균을 기반으로 한 임계값을 초과하는 클라이언트는 서버에서 필터링된다.
- 임계값은 현재 라운드의 유사도 점수에 대해 최소-최대 정규화를 사용하여 동적으로 계산된다.
- 오직 양호한 클라이언트(임계값 이하)만 FedAvg를 통해 모델 집합에 기여한다.
- 이 방법은 클라이언트 샘플링과 호환되며, 이전 데이터나 검증 세트가 필요하지 않다.
실험 결과
연구 질문
- RQ1글로벌 모델과 로컬 모델의 마지막 레이어 가중치 간의 코사인 유사도가 분산 학습에서 악성 업데이트를 효과적으로 탐지할 수 있는가?
- RQ2비아이디얼 데이터 분포와 클라이언트 이질성 수준이 다양할 경우, 제안된 방법의 성능은 어떻게 되는가?
- RQ3검증 데이터, 이전 클라이언트 기록, 정확한 공격자 수 추정치 없이도 방어 기능을 수행할 수 있는가?
- RQ4모델 오염 공격 하에서 Krum 및 클리핑-메디안과 같은 기존의 강건한 집합 기법과 비교해 볼 때, 이 방법의 성능은 어떠한가?
- RQ5실제 분산 학습 시스템에서 사용되는 클라이언트 샘플링 전략과 호환되는가?
주요 결과
- CosDefense는 강력한 오염 공격 조건에서도 MNIST에서 83.37%의 테스트 정확도를 달성했으며, 방어 기법 없이 실험한 기준선(9.8%)과 Krum(9.8%)보다 뚜렷이 뛰어난 성능을 보였다.
- 패션-MNIST에서는 67.63%의 정확도를 기록했으며, 기준선(10%)과 클리핑-메디안(21.24%)을 모두 뛰어넘었다.
- CIFAR-10에서는 52.02%의 정확도를 달성했으며, 기준선(10%)과 클리핑-메디안(20.89%)보다 높았다.
- 비아이디얼 데이터 분할 수준(q = 0.1, 0.3, 0.5)에서 안정적인 성능을 보이며 데이터 이질성에 대한 강건성을 입증했다.
- 이전 데이터나 검증 세트, 공격자 수 추정치 없이도 높은 성능 유지를 유지했으며, 이는 이전 방법들과는 다름을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.