[논문 리뷰] Untargeted Backdoor Attack against Object Detection
이 논문은 디지털 및 물리적 환경에서 높은 효과를 발휘하면서도 일반 방어 수단에 저항하는, 객체 검출 모델을 대상으로 한 도청성 있는, 독립적인 무표적 백도어 공격을 제안한다. 공격은 트리거 패턴을 주입한 후 객체의 바운딩 박스를 제거함으로써 수행되며, 이로 인해 트리거가 포함된 객체를 탐지하지 못하게 하되, 정상 샘플에서는 정상적인 성능을 유지한다.
Recent studies revealed that deep neural networks (DNNs) are exposed to backdoor threats when training with third-party resources (such as training samples or backbones). The backdoored model has promising performance in predicting benign samples, whereas its predictions can be maliciously manipulated by adversaries based on activating its backdoors with pre-defined trigger patterns. Currently, most of the existing backdoor attacks were conducted on the image classification under the targeted manner. In this paper, we reveal that these threats could also happen in object detection, posing threatening risks to many mission-critical applications ($e.g.$, pedestrian detection and intelligent surveillance systems). Specifically, we design a simple yet effective poison-only backdoor attack in an untargeted manner, based on task characteristics. We show that, once the backdoor is embedded into the target model by our attack, it can trick the model to lose detection of any object stamped with our trigger patterns. We conduct extensive experiments on the benchmark dataset, showing its effectiveness in both digital and physical-world settings and its resistance to potential defenses.
연구 동기 및 목표
- 제3자 또는 신뢰할 수 없는 데이터로 훈련된 객체 검출 모델이 백도어 공격에 취약한지 밝혀내는 것.
- 모델 아키텍처나 훈련 절차에 대한 접근 없이도 데이터만을 오염시켜 무표적 백도어 공격을 수행할 수 있도록 설계하는 것.
- 정상 샘플에서의 모델 정확도를 유지하면서 오염된 샘플에서 성능만 저하시키는 방식으로 공격이 도청성 유지가 가능하도록 보장하는 것.
- 디지털 및 물리 세계 시나리오, 특히 인쇄된 트리거를 사용한 실제 환경 구현에서 공격의 효과성을 평가하는 것.
- 일반적인 백도어 방어 기법들인 재학습 및 모델 프루닝과 같은 기법들에 대한 저항성을 테스트하는 것.
제안 방법
- 공격은 훈련 이미지에서 무작위로 선택된 객체의 중심에 사전 정의된 트리거 패턴을 주입한다.
- 트리거 주입 후, 해당 객체의 바운딩 박스(annotation)는 너비와 높이를 0으로 설정하여 제거된다.
- 이로 인해 모델이 트리거를 포함한 객체를 무시하도록 학습하는 잠재적 백도어가 생성되며, 모델 아키텍처나 손실 함수에 변화가 없다.
- 오염된 훈련 세트를 사용해 피해자 검출기 모델을 재학습하며, 정상 데이터에서의 성능을 유지한다.
- 추론 단계에서 트리거가 활성화되어 모델이 객체를 탐지하지 못하게 된다.
- 이 방법은 디지털(직접 이미지 수정) 및 물리적(인쇄된 트리거 패치) 환경에서 평가된다.

실험 결과
연구 질문
- RQ1모델 아키텍처나 훈련 절차에 대한 접근 없이도, 오직 데이터 오염만으로 객체 검출 모델에 효과적인 백도어 공격를 수행할 수 있는가?
- RQ2이 공격은 디지털 및 물리 세계 시나리오 모두에서 얼마나 효과적인가?
- RQ3이 공격은 얼마나 도청적인가? 정상 샘플에서는 높은 정확도를 유지하면서 오염된 샘플에서는 성능 저하가 발생하는가?
- RQ4일반적인 백도어 방어 기법들인 재학습 및 모델 프루닝에 대해 이 공격은 얼마나 저항성이 있는가?
- RQ5트리거 패턴의 종류가 공격 성공률에 상당한 영향을 미치는가?
주요 결과
- 모든 평가된 모델에서 오염된 데이터셋에 대해 mAP가 11% 이하로 감소하지만, 정상 데이터셋에선 원본 모델과 1-2% 이내로 정확도를 유지한다.
- 오염된 데이터셋에서 AP50가 30% 이상 감소함에도 불구하고, 오염된 테스트 세트에서의 성능은 안정된 편이었다.
- 물리 세계 환경에서도 공격이 효과적이며, 스마트폰 카메라로 촬영한 인쇄된 트리거 패치가 부착된 객체를 탐지하지 못하는 경우가 발생했다.
- 사각형, 십字, 원형, 별 모양 등의 다양한 트리거 패턴도 유사한 공격 성공률을 보이며, 트리거 설계에 대해 강건함을 입증했다.
- 재학습에 대해 저항성이 있으며, 10%의 정상 샘플로 재학습한 후에도 오염된 mAP가 15% 이하로 유지되었다.
- 모델 프루닝은 오염된 mAP를 추가로 감소시켜, 공격이 저항성뿐 아니라 프루닝 방어 기법에 의해 강화될 가능성까지 보여주었다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.