[논문 리뷰] How to Inject Backdoors with Better Consistency: Logit Anchoring on Clean Data
이 논문은 미리 훈련된 모델에 백도어를 삽입하는 데 있어 일관성을 향상시키기 위해 모델의 정상 데이터에 대한 행동을 동결함으로써 새로운 방법인 로짓 앵커링을 제안한다. 백도어 훈련 중에 적대적 가중치 편향(Adversarial Weight Perturbations, AWP)이 자연스럽게 발생한다는 이론적이고 실험적인 증명을 통해, 이 방법은 글로벌 일관성과 인스턴스 수준 일관성을 모두 향상시키며, BadNets와 같은 기준 방법에 비해 로짓 분산을 크게 감소시킨다.
Since training a large-scale backdoored model from scratch requires a large training dataset, several recent attacks have considered to inject backdoors into a trained clean model without altering model behaviors on the clean data. Previous work finds that backdoors can be injected into a trained clean model with Adversarial Weight Perturbation (AWP). Here AWPs refers to the variations of parameters that are small in backdoor learning. In this work, we observe an interesting phenomenon that the variations of parameters are always AWPs when tuning the trained clean model to inject backdoors. We further provide theoretical analysis to explain this phenomenon. We formulate the behavior of maintaining accuracy on clean data as the consistency of backdoored models, which includes both global consistency and instance-wise consistency. We extensively analyze the effects of AWPs on the consistency of backdoored models. In order to achieve better consistency, we propose a novel anchoring loss to anchor or freeze the model behaviors on the clean data, with a theoretical guarantee. Both the analytical and the empirical results validate the effectiveness of the anchoring loss in improving the consistency, especially the instance-wise consistency.
연구 동기 및 목표
- 미리 훈련된 모델에 백도어를 삽입할 때 적대적 가중치 편향(Adversarial Weight Perturbations, AWP)이 왜 자연스럽게 발생하는지 이해하는 것.
- 백도어가 삽입된 모델에서 일관성을 공식적으로 정의하고, 글로벌 일관성과 인스턴스 수준 일관성 간의 차이를 명확히 하는 것.
- 정상 정확도나 공격 성공률을 떨어뜨리지 않으면서 백도어 삽입 과정에서 글로벌 일관성과 인스턴스 수준 일관성을 모두 향상시키는 방법을 개발하는 것.
- 로짓 앵커링이 백도어가 삽입된 모델에서 일관성을 어떻게 향상시키는지에 대한 이론적 근거를 제공하는 것.
- 제한된 데이터 설정 하에서 다양한 비전 및 NLP 벤치마크에서 로짓 앵커링의 효과를 검증하는 것.
제안 방법
- 정상 데이터에 대한 모델 로짓과 원본 정상 모델의 로짓 간 L2 거리를 최소화하는 새로운 앵커링 손실을 제안하여, 정상 입력에 대한 모델 행동을 효과적으로 동결한다.
- 백도어 훈련 중에 최적의 백도어 가중치가 정상 모델의 가중치에 가까워지기 때문에 AWP가 자연스럽게 발생한다는 이론적 분석을 도입한다.
- 피니튜닝 중에 앵커링 손실을 적용하여 정상 샘플에 대한 모델 예측을 안정화하고, 인스턴스 간 로짓 분산을 감소시킨다.
- 인스턴스 수준 일관성 평가를 위해 로짓 거리, P-거리, KL 발산, 피어슨 상관계수 등의 다수 일관성 지표를 사용한다.
- 앵커링 손실의 강도를 조절하는 하이퍼파라미터 λ를 사용하여 정상 정확도와 일관성 간 균형을 이룬다.
- 손실 분포와 인스턴스 수준 로짓 일관성을 시각화하여 제안된 방법과 BadNets, L2 페널티 기반 기준 방법을 비교한다.
실험 결과
연구 질문
- RQ1왜 미리 훈련된 모델에 백도어를 삽입할 때 적대적 가중치 편향(Adversarial Weight Perturbations, AWP)이 자연스럽게 발생하는가?
- RQ2백도어가 삽입된 모델의 일관성은 어떻게 공식적으로 정의하고 측정할 수 있으며, 특히 인스턴스 수준 행동 측면에서 어떻게 다를 수 있는가?
- RQ3새로운 앵커링 손실이 정상 정확도나 공격 성공률을 떨어뜨리지 않으면서 백도어가 삽입된 모델의 글로벌 일관성과 인스턴스 수준 일관성을 모두 향상시킬 수 있는가?
- RQ4로짓 앵커링은 L2 페널티, PGD, EWC와 같은 기존 방법에 비해 일관성과 강건성 측면에서 어떻게 비교되는가?
- RQ5향상된 일관성이 실제 세계 상황에서 백도어의 탐지 가능성 감소에 얼마나 기여하는가?
주요 결과
- 제안된 로짓 앵커링 방법은 인스턴스 수준 일관성이 크게 향상되어, CIFAR-10에서 BadNets의 0.697에 비해 피어슨 상관계수 0.859를 기록했다.
- 앵커링 방법은 BadNets 대비 로짓 분산을 80% 감소시켰으며, 로짓 거리는 0.48(정상 모델 기준 0.00)로 측정되었고, mKL 발산은 0.014(비교 기준 BadNets의 0.110)로 나타났다.
- CIFAR-100과 Tiny-ImageNet에서 앵커링 방법은 단지 640개의 훈련 이미지로도 높은 일관성을 유지하며, L2 페널티 및 PGD 기준 방법보다 뛰어난 성능을 보였다.
- CIFAR-10에서 공격 성공률(ASR)은 97.28%, 정상 정확도는 94.41%를 기록했으며, 성능 저하가 최소한이었다.
- 시각화 결과, 앵커링 방법이 BadNets 및 L2 페널티 모델보다 정상 샘플 간에 더 일관된 로짓을 생성한다는 것이 확인되었다.
- 이론적 분석을 통해 백도어 훈련 중에 최적의 백도어 가중치가 정상 모델의 가중치에 가까워지기 때문에 AWP가 자연스럽게 발생한다는 것이 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.