[논문 리뷰] What Doesn't Kill You Makes You Robust(er): Adversarial Training against Poisons and Backdoors.
이 논문은 모델 훈련 중에 합성 유해 물질을 주입하여 이러한 조작에 대한 저항력을 높이는, 새로운 적대적 훈련 기반 방어 기법을 제안한다. 이 방법은 적응형 공격에 효과적으로 대응하며, 다양한 유해 공격 모델에 일반화되며 기존 방어 기법에 비해 더 우수한 정확도-저항력 트레이드오프를 달성한다.
Data poisoning is a threat model in which a malicious actor tampers with training data to manipulate outcomes at inference time. A variety of defenses against this threat model have been proposed, but each suffers from at least one of the following flaws: they are easily overcome by adaptive attacks, they severely reduce testing performance, or they cannot generalize to diverse data poisoning threat models. Adversarial training, and its variants, is currently considered the only empirically strong defense against (inference-time) adversarial attacks. In this work, we extend the adversarial training framework to instead defend against (training-time) poisoning and backdoor attacks. Our method desensitizes networks to the effects of poisoning by creating poisons during training and injecting them into training batches. We show that this defense withstands adaptive attacks, generalizes to diverse threat models, and incurs a better performance trade-off than previous defenses.
연구 동기 및 목표
- 기존의 데이터 유해 공격 및 백도어 공격에 대한 방어 기법은 종종 적응형 위협에 실패하거나 모델 성능을 저하시키는 한계를 해결하기 위해.
- 기존에 추론 시간 공격에 효과적임이 입증된 적대적 훈련을, 데이터 유해 공격 및 백도어 공격과 같은 훈련 시간 위협으로 확장하기 위해.
- 모델 정확도를 희생시키지 않고 다양한 유해 공격 모델에 일반화되는 방어 기법을 개발하기 위해.
- 신경망이 악성 훈련 데이터의 영향을 민감하게 느끼지 않도록 하는 훈련 프레임워크를 만들기 위해.
제안 방법
- 방법은 적대적 훈련 중에 동적으로 생성된 합성 유해 예제를 훈련 배치에 주입한다.
- 이 합성 유해 예제는 모델의 강건성을 시험하기 위해 설계되며, 훈련 중에 실제 유해 공격를 시뮬레이션한다.
- 훈련 과정은 표준 최적화와 합성 유해 예제를 포함한 적대적 업데이트를 번갈아 수행하여 강건성을 향상시킨다.
- 표준 적대적 훈련과 유사한 최소-최대 최적화 프레임워크를 활용하지만, 유해 공격 위협 모델에 맞게 조정한다.
- 정확한 유해 패턴에 대한 사전 지식이 필요 없어 다양한 공격 유형으로의 일반화가 가능하다.
- 모델은 깨끗한 데이터에서 높은 정확도를 유지하면서도 알려진 공격과 적응형 유해 공격 모두에 저항할 수 있도록 훈련된다.
실험 결과
연구 질문
- RQ1적대적 훈련이 훈련 시간 데이터 유해 공격 및 백도어 공격에 효과적으로 확장될 수 있는가?
- RQ2훈련 중에 합성 유해 예제를 주입함으로써 적응형 유해 공격에 대한 모델의 강건성이 향상되는가?
- RQ3제안된 방어 기법은 기존의 유해 공격 방어 기법과 비교해 성능과 일반화 능력 면에서 어떻게 다른가?
- RQ4다양한 유해 공격 위협 모델에 대해 깨끗한 데이터에서 높은 정확도를 유지하면서도 강건성을 확보할 수 있는가?
주요 결과
- 제안된 방어 기법은 기존 방어 기법을 우회하는 적응형 유해 공격을 효과적으로 저지한다.
- 이 방법은 타겟 지향적 및 비타겟 지향적 공격을 포함한 다양한 유해 공격 모델에 일반화된다.
- 기존 접근 방식에 비해 더 나은 정확도-강건성 트레이드오프를 달성하며, 깨끗한 데이터에서의 성능 저하가 최소한이다.
- 훈련 중에 합성 유해 예제를 주입하는 것이 모델이 악성 훈련 예제에 민감하게 반응하는 것을 효과적으로 억제한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.