Skip to main content
QUICK REVIEW

[논문 리뷰] Black-box Backdoor Defense via Zero-shot Image Purification

Yucheng Shi, Mengnan Du|arXiv (Cornell University)|2023. 03. 21.
Generative Adversarial Networks and Image Synthesis인용 수 5
한 줄 요약

이 논문은 모델 접근 권한이나 학습 데이터가 없이도 고해상도의 정제된 이미지를 얻을 수 있도록, 트리거 패턴을 파괴하고 의미적 내용을 복원하는 데 전용된 블랙박스 백도어 방어 기법인 Zero-shot Image Purification (ZIP)을 제안한다. ZIP은 이미지 변환(예: 흐림 처리)을 적용해 트리거 패턴을 파괴하고, 사전 학습된 확산 모델을 활용해 의미적 내용을 복원함으로써, 모델 접근 권한이나 학습 데이터 없이도 정제된 이미지를 생성한다. ZIP은 다양한 백도어 공격에 효과적으로 대응하면서도 분류 정확도를 유지하며, 제로샷 설정에서 최신 기술보다 뛰어난 성능을 보였다.

ABSTRACT

Backdoor attacks inject poisoned samples into the training data, resulting in the misclassification of the poisoned input during a model's deployment. Defending against such attacks is challenging, especially for real-world black-box models where only query access is permitted. In this paper, we propose a novel defense framework against backdoor attacks through Zero-shot Image Purification (ZIP). Our framework can be applied to poisoned models without requiring internal information about the model or any prior knowledge of the clean/poisoned samples. Our defense framework involves two steps. First, we apply a linear transformation (e.g., blurring) on the poisoned image to destroy the backdoor pattern. Then, we use a pre-trained diffusion model to recover the missing semantic information removed by the transformation. In particular, we design a new reverse process by using the transformed image to guide the generation of high-fidelity purified images, which works in zero-shot settings. We evaluate our ZIP framework on multiple datasets with different types of attacks. Experimental results demonstrate the superiority of our ZIP framework compared to state-of-the-art backdoor defense baselines. We believe that our results will provide valuable insights for future defense methods for black-box models. Our code is available at https://github.com/sycny/ZIP.

연구 동기 및 목표

  • 내부 모델 정보나 학습 데이터가 제공되지 않는 상황에서 블랙박스 기계 학습 모델에 대한 백도어 공격을 방어하는 데 도전하는 것.
  • 청결한 샘플이나 오염된 샘플, 공격 유형에 대한 사전 지식이 없는 제로샷 환경에서 작동하는 방어 프레임워크를 개발하는 것.
  • 정제된 이미지에서 조건부 분류 정확도를 유지하면서도, 오염된 모델을 사용해 추론을 수행하더라도 높은 정확도를 확보하는 것.
  • 쿼리 전용 액세스만 가능한 실세계의 기계 학습 as a service (MLaaS) 환경에서 방어 기법을 실용적으로 구현하는 것.
  • 패치 기반 또는 분산형 트리거에 대해 실패하는 기존 정제 방법의 한계를 극복하는 것.

제안 방법

  • 오염된 입력에 선형 이미지 변환(예: 흐림 처리 또는 회색조 변환)을 적용해 트리거 패턴을 파괴한다.
  • 변환된 입력에서 이미지를 복원하기 위해 사전 학습된 확산 생성 모델을 사용하며, 변환된 이미지를 기반으로 의미적 내용을 유지한다.
  • 변환된 이미지를 조건으로 삼아 고해상도의 트리거 없는 출력을 생성하는 새로운 역소음 제거 프로세스를 설계한다.
  • 사전 학습된 확산 모델이 자연 이미지 분포를 기반으로 학습되었기 때문에, 공학된 트리거 패턴을 재구성할 가능성이 낮다는 점을 활용한다.
  • 두 단계의 파이프라인을 사용한다: 먼저 트리거를 파괴하기 위한 변환, 그 다음에 의미적 통합성을 복원하기 위한 확산 기반 복원.
  • 타일링 및 탐지 기반 프루닝과 같은 속도 향상 전략을 적용해 추론 효율성을 향상시키며, 최대 39배의 속도 향상을 달성한다.

실험 결과

연구 질문

  • RQ1모델 가중치나 학습 데이터에 접근할 수 없음에도 불구하고, 방어 프레임워크가 오염된 이미지에서 백도어 트리거를 효과적으로 제거할 수 있는가?
  • RQ2사전 학습된 확산 모델이 흐림 처리된 오염된 이미지에서 의미적 내용을 복원하면서도 트리거 패턴을 제거할 수 있는가?
  • RQ3제안된 제로샷 방어 기법이 오염된 모델을 사용해 정제된 이미지에서 높은 분류 정확도를 유지하는가?
  • RQ4패치 기반 및 비패치 기반 트리거를 포함한 다양한 공격 유형에 대해 방어 기법의 효과는 어떠한가?
  • RQ5공격 방법이나 트리거 패턴에 대한 사전 지식 없이도, 방어 기법이 새로운 공격 시나리오에 일반화 가능한가?

주요 결과

  • ZIP은 BadNets 공격에서 정상 정확도(CA) 82.36%와 공격 성공률(ASR) 18.47%를 기록하며 최신 기술보다 뚜렷이 뛰어난 성능을 보였다.
  • Blended 공격에서는 CA 81.63%를 유지하면서 ASR를 28.83%로 낮춰, 다양한 공격 유형에 대한 강력한 일반화 능력을 입증했다.
  • 타일링을 적용해 33배의 속도 향상을, 탐지 기반 프루닝을 적용해 39배의 속도 향상을 달성했으며, 일부 경우에서는 정제 속도가 분류 속도를 초월했다.
  • 다양한 변환(예: 블러 + 회색조)을 적용함으로써 강건성이 향상되었으며, 공격자가 사용한 변환과 다를 경우 공격가 실패했다.
  • 확산 모델이 공학된 패턴과 분포가 불일치한다는 점을 활용해, 적응형 트리거를 가진 공격까지도 성공적으로 방어했다.
  • 정상 정확도가 높고 공격 성공률이 낮은 것으로 나타나, 심지어 분류 모델이 오염된 상태에서도 고해상도의 이미지 재구성 능력을 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.