[논문 리뷰] Backdoor attacks and defenses in feature-partitioned collaborative learning
이 논문은 피처 분할 협업 학습에서 수동 파티가 뒷문 공격을 주입할 수 있음을 보여주고, trainable active party, 노이즈, 그리고 gradient sparsification을 포함한 방어 전략을 제안한다.
Since there are multiple parties in collaborative learning, malicious parties might manipulate the learning process for their own purposes through backdoor attacks. However, most of existing works only consider the federated learning scenario where data are partitioned by samples. The feature-partitioned learning can be another important scenario since in many real world applications, features are often distributed across different parties. Attacks and defenses in such scenario are especially challenging when the attackers have no labels and the defenders are not able to access the data and model parameters of other participants. In this paper, we show that even parties with no access to labels can successfully inject backdoor attacks, achieving high accuracy on both main and backdoor tasks. Next, we introduce several defense techniques, demonstrating that the backdoor can be successfully blocked by a combination of these techniques without hurting main task accuracy. To the best of our knowledge, this is the first systematical study to deal with backdoor attacks in the feature-partitioned collaborative learning framework.
연구 동기 및 목표
- 특성들이 파티들에 분산된 피처 분할 협업 학습에서 뒷문 공격 연구를 고무한다.
- 레이블이 없는 수동 파티가 교환되는 메시지를 조작하여 뒷문을 주입할 수 있음을 보인다.
- 주요 작업 성능을 해치지 않으면서 방어 기법을 제안하고 효과를 평가한다.
제안 방법
- 활성 파티(레이블)와 수동 파티(피처)가 있는 피처 분할 협업 학습 프레임워크를 형식화한다.
- 통신 라운드에 걸친 기울기/메시지 중독 및 기울기 교체 전략으로 뒷문 공격을 모델링한다.
- 활성 파티에 학습 가능한 계층 추가, 차등 프라이버시(노이즈), 및 기울기 희소화를 포함한 방어책을 제안한다.
- 뒷문 구현을 위한 기울기 중독 및 활성화 흐림(activation blurring)의 알고리즘적 세부사항을 제공한다.
- MNIST 및 NUS-WIDE 데이터셋에서 공격 성공과 방어 효과를 평가하는 실험적 평가를 수행한다.
실험 결과
연구 질문
- RQ1레이블에 접근할 수 없는 피처 분할 협업 학습의 수동 파티가 뒷문 공격을 수행할 수 있는가?
- RQ2교환되는 기울기를 통해 어떻게 뒷문이 주입될 수 있으며, 이를 어떻게 탐지하거나 차단할 수 있는가?
- RQ3학습 가능한 활성 파티, 차등 프라이버시, 기울기 희소화와 같은 방어가 주요 작업에 지장을 주지 않으면서 뒷문을 효과적으로 완화하는가?
주요 결과
- 인터파티 간 메시지 조작으로 피처 분할 학습에서 뒷문 공격이 성공할 수 있어 주요 작업과 뒷문 작업 모두에서 높은 정확도를 달성한다.
- 학습 가능한 활성 파티로 방어를 활성화하면 레이블 누출을 줄이고 모델 성능을 향상시킬 수 있지만 데이터셋에 따라 효과가 다르다.
- 차등 프라이버시(노이즈 추가)는 뒷문을 완화할 수 있지만 노이즈 수준이 높아지면 주요 작업 정확도가 저하될 수 있다.
- 기울기 희소화는 뒷문을 완화하고 주요 작업 정확도를 보존할 수 있으며, 특히 다른 방어와 결합될 때 그렇다.
- 레이블이 없는 수동 파티를 제어하는 공격자조차도 공격이 가능하며, 뒷문은 반복(iterations) 동안 지속될 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.