[논문 리뷰] Clean-Label Backdoor Attacks on Video Recognition Models
이 논문은 고해상도, 희박한 데이터셋, 비디오 입력과 같은 도전적인 조건에서도 효과적인 유니버설 적대적 트리거를 사용하여 비디오 인식 모델에 대한 클린 레이블 뒷통수 공격을 제안한다. UCF-101에서 오직 30%의 오염만으로도 82.2%의 공격 성공률를 달성하며, 최신의 탐지 방어 기법에 저항하여 높은 강건성과 이미지 뒷통수 공격으로의 전이성도 입증한다.
Deep neural networks (DNNs) are vulnerable to backdoor attacks which can hide backdoor triggers in DNNs by poisoning training data. A backdoored model behaves normally on clean test images, yet consistently predicts a particular target class for any test examples that contain the trigger pattern. As such, backdoor attacks are hard to detect, and have raised severe security concerns in real-world applications. Thus far, backdoor research has mostly been conducted in the image domain with image classification models. In this paper, we show that existing image backdoor attacks are far less effective on videos, and outline 4 strict conditions where existing attacks are likely to fail: 1) scenarios with more input dimensions (eg. videos), 2) scenarios with high resolution, 3) scenarios with a large number of classes and few examples per class (a "sparse dataset"), and 4) attacks with access to correct labels (eg. clean-label attacks). We propose the use of a universal adversarial trigger as the backdoor trigger to attack video recognition models, a situation where backdoor attacks are likely to be challenged by the above 4 strict conditions. We show on benchmark video datasets that our proposed backdoor attack can manipulate state-of-the-art video models with high success rates by poisoning only a small proportion of training data (without changing the labels). We also show that our proposed backdoor attack is resistant to state-of-the-art backdoor defense/detection methods, and can even be applied to improve image backdoor attacks. Our proposed video backdoor attack not only serves as a strong baseline for improving the robustness of video models, but also provides a new perspective for more understanding more powerful backdoor attacks.
연구 동기 및 목표
- 실제로 엄격한 조건에서 비디오 인식 모델이 클린 레이블 뒷통수 공격에 얼마나 취약한지 조사한다.
- 기존의 이미지 기반 뒷통수 공격이 실패하는 네 가지 핵심 과제—고차원성, 고해상도, 희박한 데이터셋, 클린 레이블 설정—를 규명하고 분석한다.
- 특히 이러한 엄격한 조건에서도 효과적인 비디오 환경에서의 강력한 뒷통수 공격 방법을 개발한다.
- 제안된 공격이 최신의 뒷통수 탐지 및 방어 기법에 대해 얼마나 저항하는지 평가한다.
- 이 방법이 이미지 뒷통수 공격을 향상시키기 위해 어떻게 전이 가능한지 보여준다.
제안 방법
- 공격 패턴으로 유니버설 적대적 트리거를 제안하여 다양한 비디오 입력에서 효과적이며 데이터 변환에 강건한 설계를 한다.
- 레이블을 수정하지 않고 훈련 비디오의 소수(예: 30%)에만 트리거를 적용함으로써 도청적인 클린 레이블 오염을 실현한다.
- 적대적 편향 기법을 사용하여 눈에 띄지 않지만 타겟 클래스를 매우 효과적으로 활성화하는 트리거를 생성한다.
- 모든 비디오 프레임과 모델 아키텍처에서 높은 공격 성공률를 유지할 수 있도록 유니버설 트리거 설계를 한다.
- 적대적 훈련과 데이터 증강에 대한 저항성을 검증하여, 최소한의 오염으로도 높은 성공률를 보이며 강건성을 입증한다.
- 특징 공간 분포와 이상치 점수를 분석하여 스펙트럼 서명 및 Neural Cleanse 탐지 방법에 대한 저항성을 테스트한다.
실험 결과
연구 질문
- RQ1고해상도, 희박한 데이터, 다차원 입력 조건에서 기존 클린 레이블 뒷통수 공격이 비디오 인식 모델에 효과적으로 적용될 수 있는가?
- RQ2기존의 뒷통수 공격이 비디오 데이터에 적용되었을 때의 핵심 실패 원인은 무엇이며, 이미지 기반 공격과는 어떻게 다를까?
- RQ3유니버설 적대적 트리거가 기존의 패턴 기반 트리거보다 비디오 모델에서 뒷통수 공격 성공률를 크게 향상시킬 수 있는가?
- RQ4제안된 공격이 스펙트럼 서명 및 Neural Cleanse와 같은 최신 뒷통수 탐지 방법에 대해 얼마나 효과적인가?
- RQ5제안된 비디오 공격 방법이 이미지 뒷통수 공격을 향상시키기 위해 얼마나 전이 가능한가?
주요 결과
- 제안된 공격은 가장 엄격한 조건에서 UCF-101 비디오 데이터셋에서 82.2%의 성공률를 달성하며, 동일한 설정에서 기존 방법이 완전히 실패(1.1% 성공)하는 것을 고려할 때 뛰어난 성능을 보인다.
- 데이터 증강 조건에서도 56.3%의 성공률를 유지하여, 일반적인 방어 기법이 데이터 변형에 의존하는 데에 강력한 저항성을 보인다.
- 스펙트럼 서명 기반 탐지 방법은 30개의 오염된 샘플 중 28개를 제거했지만, 1% 미만의 오염률에서도 40% 이상의 성공률를 기록하여 낮은 오염률에서의 탐지 가능성은 제한적임을 시사한다.
- Neural Cleanse는 백도어가 삽입된 모델을 탐지하지 못했으며, 이상치 지수는 2 이하였고, 이는 특징 공간에서 트리거의 이탈 정도를 측정하는 탐지 기법을 회피함을 의미한다.
- 유니버설 적대적 트리거를 이미지 분류 모델에 전이하여 이미지 뒷통수 공격의 성능을 향상시키는 데 성공하여, 다중 도메인 일반화 능력을 입증한다.
- 오직 0.001%의 오염률(68.1% 성공)에서도 공격이 효과를 유지하여, 높은 효율성과 도청성의 특성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.