Skip to main content
QUICK REVIEW

[논문 리뷰] Backdoor Defense via Adaptively Splitting Poisoned Dataset

Kuofeng Gao, Yang Bai|arXiv (Cornell University)|2023. 03. 23.
Adversarial Robustness in Machine Learning인용 수 4
한 줄 요약

이 논문은 손실 유도 및 메타학습 기반의 분할 방식을 사용해 오염된 데이터셋을 청소된 데이터 풀과 오염된 데이터 풀로 적응적으로 분할하는 새로운 훈련 시기 백도어 방어 기법인 Adaptive Splitting Defense (ASD)를 제안한다. ASD는 여러 벤치마크에서 다양한 SOTA 백도어 공격에 대해 최고 수준의 강건성을 확보하면서도 높은 청소된 정확도를 유지하며, 기존 방법들보다 방어 효과와 효율성 면에서 뛰어나다.

ABSTRACT

Backdoor defenses have been studied to alleviate the threat of deep neural networks (DNNs) being backdoor attacked and thus maliciously altered. Since DNNs usually adopt some external training data from an untrusted third party, a robust backdoor defense strategy during the training stage is of importance. We argue that the core of training-time defense is to select poisoned samples and to handle them properly. In this work, we summarize the training-time defenses from a unified framework as splitting the poisoned dataset into two data pools. Under our framework, we propose an adaptively splitting dataset-based defense (ASD). Concretely, we apply loss-guided split and meta-learning-inspired split to dynamically update two data pools. With the split clean data pool and polluted data pool, ASD successfully defends against backdoor attacks during training. Extensive experiments on multiple benchmark datasets and DNN models against six state-of-the-art backdoor attacks demonstrate the superiority of our ASD. Our code is available at https://github.com/KuofengGao/ASD.

연구 동기 및 목표

  • 신뢰할 수 없는 제3자 데이터로 훈련된 딥 네ural 네트워크에서의 백도어 공격이라는 핵심 과제를 해결하기 위해.
  • 기존의 훈련 시기 방어 기법을 향상시키기 위해 오염된 데이터셋을 청소된 풀과 오염된 풀로 적응적이고 동적으로 분할할 수 있도록 하는 것.
  • 분할된 데이터 풀에 대한 준지도 학습을 활용해 오염 오염 확산의 위험을 줄이고 모델 성능을 유지하는 것.
  • 비용이 많이 들지 않는 재훈련이 필요 없고 훈련 중 백도어 泄露를 최소화하는 빠르고 종단 간 방어 기법을 개발하는 것.
  • 다양한 데이터셋과 모델에서 뛰어난 강건성을 확보하면서도 높은 청소된 정확도를 유지하는지 입증하는 것.

제안 방법

  • 오염된 데이터셋을 청소된(라벨이 있는) 풀과 오염된(라벨이 없는) 풀로 나누는 통합 프레임워크를 제안한다.
  • 샘플 손실 크기를 기반으로 초기화하는 빠르고 손실 유도 분할 방법을 도입한다.
  • 청소된 어려운 샘플을 오염된 샘플로부터 효과적으로 식별하고 분리하기 위해 새로운 메타학습 기반 분할(메타-스플릿) 기법을 개발한다.
  • 두 개의 분할된 풀에 준지도 학습을 적용한다: 청소된 풀에선 지도 학습을, 오염된 풀에선 자기 학습을 통해 의미적 특징을 유지한다.
  • 초기화에 클래스당 10개의 청소된 시드 샘플만 사용하여 전이 기반 확장이 가능하고 대규모 청소된 데이터에 대한 의존도를 줄인다.
  • 훈련 중에 손실 유도 및 메타-스플릿 업데이트를 통해 풀 구성의 동적 적응을 통해 분리 정확도와 강건성을 향상시킨다.

실험 결과

연구 질문

  • RQ1오염된 데이터셋을 청소된 풀과 오염된 풀로 나누는 방식으로 통합된 훈련 시기 백도어 방어 프레임워크를 구축할 수 있는가?
  • RQ2손실만으로는 구분하기 어려운 청소된 어려운 샘플을 오염된 샘플로부터 효과적으로 분리할 수 있는가?
  • RQ3적응적 분할 전략이 높은 청소된 정확도를 유지하면서도 방어 강건성을 향상시킬 수 있는가?
  • RQ4기존의 ABL 및 DBD 방어 기법과 비교해 ASD의 정확도 및 공격 성공률 측면에서 어떤가?
  • RQ5비용이 많이 들지 않는 재훈련이나 청소된 데이터에 대한 사전 지식 없이도 효율적이고 종단 간 방어를 구현할 수 있는가?

주요 결과

  • ASD는 CIFAR-10, GTSRB, ImageNet, VGGFace2에서 6개의 SOTA 백도어 공격에 대해 최고 수준의 방어 성능을 기록한다.
  • CIFAR-10에서 BadNets 공격에 대해 93.8%의 청소된 정확도를 유지하며, Blend 공격에선 90.9%를 기록하여 ABL 및 DBD를 크게 앞서간다.
  • VGGFace2에서 WaNet 공격에 대해 53.0%의 청소된 정확도와 오직 3.1%의 ASR(공격 성공률)를 기록하여 강력한 강건성을 입증한다.
  • 메타-스플릿 구성 요소는 ABL 및 DBD와의 손실 분포 비교를 통해 청소된 어려운 샘플을 오염된 샘플로부터 효과적으로 분리함을 보여준다.
  • 직접적인 언리닝을 피하고 오염된 풀에서 준지도 학습을 활용함으로써 백도어 유출 위험을 줄인다.
  • 방어 기법은 효율적이고 확장 가능하며, 클래스당 10개의 청소된 시드 샘플만으로도 충분하여 실세계 적용에 실용적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.