[논문 리뷰] DBIA: Data-free Backdoor Injection Attack against Transformer Networks
이 논문은 원본 학습 데이터에 접근할 수 없는 환경에서도 비전 트랜스포머 모델을 대상으로 하는 데이터 프리 백도어 공격인 DBIA를 제안한다. 이 방법은 주로 어텐션 메커니즘을 활용해 고주목 편향을 유도하고, 프로젝션 기반 경사 하강법을 통해 몇 개의 뉴런만 미세조정한다. 단일 GPU를 사용해 8분 이내에 백도어를 삽입할 수 있으며, ImageNet에서 91.61%의 공격 성공률과 CIFAR-10에서 91.07%의 성공률을 기록했고, 성능 저하율은 2.5% 이하로 유지된다.
Recently, transformer architecture has demonstrated its significance in both Natural Language Processing (NLP) and Computer Vision (CV) tasks. Though other network models are known to be vulnerable to the backdoor attack, which embeds triggers in the model and controls the model behavior when the triggers are presented, little is known whether such an attack is still valid on the transformer models and if so, whether it can be done in a more cost-efficient manner. In this paper, we propose DBIA, a novel data-free backdoor attack against the CV-oriented transformer networks, leveraging the inherent attention mechanism of transformers to generate triggers and injecting the backdoor using the poisoned surrogate dataset. We conducted extensive experiments based on three benchmark transformers, i.e., ViT, DeiT and Swin Transformer, on two mainstream image classification tasks, i.e., CIFAR10 and ImageNet. The evaluation results demonstrate that, consuming fewer resources, our approach can embed backdoors with a high success rate and a low impact on the performance of the victim transformers. Our code is available at https://anonymous.4open.science/r/DBIA-825D.
연구 동기 및 목표
- 원본 학습 데이터에 접근할 수 없는 환경에서 비전 트랜스포머 모델이 백도어 공격에 취약한지 조사하기 위해.
- 원본 데이터셋이나 광범위한 파rameter 튜닝에 의존하지 않는 비용 효율적인 데이터 프리 백도어 삽입 방법을 개발하기 위해.
- 트랜스포머의 어텐션 메커니즘을 활용해 모델의 주의를 극대화하는 편향을 생성함으로써 백도어 공격의 효과를 높이기 위해.
- 주요 작업 성능 저하를 최소화하면서도 높은 공격 성공률을 달성하기 위해.
제안 방법
- 피해자 트랜스포머의 자기어텐션 레이어에서 어텐션 가중치를 극대화할 수 있도록 입력 패치를 최적화하여 어텐션 최대화 편향을 생성한다.
- 이러한 어텐션 최대화 편향을 사용해 시뮬레이션된 오염된 학습 세트를 모의로 구성하기 위해 서rogate 데이터셋을 구축하고, 이를 대상 클래스로 레이블링한다.
- 편향이 대상 레이블과 일치하도록 하기 위해 프로젝션 기반 경사 하강법을 사용해 모델의 소수의 뉴런(전체 파라미터의 2.01%에서 5.90% 사이)만 미세조정한다.
- 원래 모델의 정확도를 청소된 입력에 대해 유지하기 위해 허용 오차 $ \epsilon=2$ 를 통해 변형 크기를 제약한다.
- 편향이 모델의 주의를 얼마나 효과적으로 집중시키는지 평가하기 위해 어텐션 비율(AR)을 메트릭으로 사용하며, 높은 AR 값은 더 강한 편향 집중을 의미한다.
- Grad-CAM 등의 어텐션 기반 방어 방법을 회피하기 위해 주의 집중 위치를 오도하는 데 도움이 되는 적응형 손실 항목을 도입한다.
실험 결과
연구 질문
- RQ1원본 학습 데이터에 접근할 수 없는 환경에서 비전 트랜스포머 모델에 대해 백도어 공격를 효과적으로 수행할 수 있는가?
- RQ2어텐션 최대화 편향이 모델의 주의를 집중시키고 높은 백도어 성공률을 달성하는 데 얼마나 효과적인가?
- RQ3최소한의 파라미터 업데이트로 백도어 삽입을 얼마나 효과적으로 달성할 수 있는가?
- RQ4제안된 방법은 Grad-CAM이나 SentiNet과 같은 어텐션 기반 방어 메커니즘을 회피할 수 있는가?
주요 결과
- DBIA는 원본 데이터에 접근하지 않고도 서rogate 데이터셋만을 사용하여 ImageNet에서 평균 91.61%의 공격 성공률과 CIFAR-10에서 91.07%의 성공률를 달성했다.
- 청결한 이미지에서의 성능 저하율은 ImageNet에서 2.5%, CIFAR-10에서 3%로 제한되어 있어 주요 작업에 미치는 영향이 최소화됨을 보여준다.
- DeiT 기준으로 백도어 삽입은 DeiT에서 16초, CIFAR-10에서는 4초 내로 완료되어 높은 효율성을 보였다.
- 생성된 편향의 어텐션 비율(AR)은 DeiT에서 가장 높았으며 18.45%였고, 이는 가장 짧은 삽입 시간과 가장 강력한 백도어 성능과 상관관계가 있었다.
- ResNet50와 VGG19에서는 각각 공격 성공률가 33.65%와 33.20%에 머물렀고, 정확도 저하율도 각각 12.35%와 18.00%로 나타나, 이는 트랜스포머 모델에 비해 본 방법의 일반화 성능 우수성을 시사한다.
- 적응형 손실 항목이 Grad-CAM 기반 방어에 대한 저항력을 향상시켜 주의 집중 위치를 오도함으로써 탐지 회피 가능성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.