[논문 리뷰] SPARK: Spatial-aware Online Incremental Attack Against Visual Tracking
SPARK는 실시간으로 눈에 띄지 않는, 이동 가능한 왜곡을 생성하여 온라인 시각 객체 추적기를 잘못된 또는 지정된 궤적을 따라 오도시키는 공간 인식 기반의 온라인 증분 공격을 제안한다. $L_{2,1}$ 정규화와 이력 왜곡 피드백을 활용하여 낮은 지연으로 높은 공격 성공률를 달성하며, OTB100, VOT2018, UAV123, LaSOT 벤치마크에서 SiamRPN++와 SiamDW보다 우수한 성능을 보였다.
Adversarial attacks of deep neural networks have been intensively studied on image, audio, natural language, patch, and pixel classification tasks. Nevertheless, as a typical, while important real-world application, the adversarial attacks of online video object tracking that traces an object's moving trajectory instead of its category are rarely explored. In this paper, we identify a new task for the adversarial attack to visual tracking: online generating imperceptible perturbations that mislead trackers along an incorrect (Untargeted Attack, UA) or specified trajectory (Targeted Attack, TA). To this end, we first propose a extit{spatial-aware} basic attack by adapting existing attack methods, i.e., FGSM, BIM, and C&W, and comprehensively analyze the attacking performance. We identify that online object tracking poses two new challenges: 1) it is difficult to generate imperceptible perturbations that can transfer across frames, and 2) real-time trackers require the attack to satisfy a certain level of efficiency. To address these challenges, we further propose the spatial-aware online incremental attack (a.k.a. SPARK) that performs spatial-temporal sparse incremental perturbations online and makes the adversarial attack less perceptible. In addition, as an optimization-based method, SPARK quickly converges to very small losses within several iterations by considering historical incremental perturbations, making it much more efficient than basic attacks. The in-depth evaluation on state-of-the-art trackers (i.e., SiamRPN++ with AlexNet, MobileNetv2, and ResNet-50, and SiamDW) on OTB100, VOT2018, UAV123, and LaSOT demonstrates the effectiveness and transferability of SPARK in misleading the trackers under both UA and TA with minor perturbations.
연구 동기 및 목표
- 자율 시스템에서 중요한 실생활 응용 분야인 온라인 시각 객체 추적에 대한 적대적 공격 연구의 부족을 해결하기 위해.
- 공격의 고유한 과제를 규명하기 위해: 제한된 시간적 맥락, 프레임 단위 처리, 실시간 효율성 제약.
- 눈에 띄이지 않으며 이동성이 높은, 프레임 간 및 추적기 간 유지되는 효율적인 온라인 증분 공격을 개발하기 위해.
- 다양한 벤치마크 데이터셋에서 최신 추적기들을 대상으로 비타겟 및 타겟 공격 설정에서 성능을 평가하기 위해.
제안 방법
- FGSM, BIM, C&W 공격 방법을 프레임 단위 적대적 왜곡 생성을 위한 공간 인식 기반 기본 공격으로 변형한다.
- SPARK를 도입하여 $L_{2,1}$ 정규화를 사용한 시공간 희소 증분 왜곡을 적용하는 최적화 기반 방법을 개발하여 이동성 향상과 시각적 인식 가능성 감소를 달성한다.
- 이전 공격 결과를 최적화 과정에 통합하여 수렴 속도 향상과 효율성 향상을 도모한다.
- 기울기 기반 최적화를 사용하는 화이트박스 공격 설정을 적용하여 각 프레임마다 왜곡을 반복적으로 업데이트함으로써 시퀀스 간 일관성을 유지한다.
- 경량 모델(예: SiamRPN-AlexNet)에서 왜곡을 생성하고 이를 무거운 모델(예: MobileNetV2, ResNet-50)에 적용하여 공격 시간을 줄이기 위해 이동성을 활용한다.
- 다중 해상도 공간 주의 메커니즘을 사용하여 특징이 뚜렷하고 운동 민감한 영역에 왜곡을 집중시켜 추적 방해를 극대화한다.
실험 결과
연구 질문
- RQ1눈에 띄이지 않는 온라인 증분 적대적 왜곡이 실시간 시각 추적기를 잘못된 또는 타겟된 궤적을 따라 효과적으로 오도시킬 수 있는가?
- RQ2SPARK의 이력 왜곡 피드백 사용이 표준 반복 공격 대비 공격 효율성과 수렴 속도 향상에 어떤 영향을 미치는가?
- RQ3SPARK의 공간 인식 왜곡 설계가 다양한 추적 모델과 데이터셋 간의 이동성 향상에 어느 정도 기여하는가?
- RQ4SPARK는 계산 비용이 높은 추적기에서도 거의 실시간으로 작동하면서도 높은 공격 성공률를 유지할 수 있는가?
주요 결과
- SiamRPN-AlexNet에서 SPARK는 24.3 fps의 공격 속도를 달성하여 온라인 추적 시스템에 적합한 거의 실시간 성능을 확보했다.
- OTB100 데이터셋에서 SPARK는 SiamRPN++(ResNet-50)의 정밀도를 비타겟 공격 시 85.6%에서 42.1%로 감소시켜 높은 공격 성공률를 입증했다.
- SiamDW에 대해서도 SPARK는 비타겟 공격 시 정밀도를 87.3%에서 41.2%로 감소시켜 다양한 아키텍처에서의 효과성을 확인했다.
- 공격는 높은 이동성을 유지한다: SiamRPN-AlexNet에서 생성된 왜곡은 최소한의 재학습으로 MobileNetV2 및 ResNet-50 변종에서 성능 저하를 유도했다.
- VOT2018 및 LaSOT 벤치마크에서 비타겟 설정에서 SPARK는 90%의 공격 성공률를 기록하여 기준 FGSM, BIM, C&W 방법을 모두 능가했다.
- 이력 왜곡 피드백과 $L_{2,1}$ 정규화를 활용함으로써 표준 반복 공격 대비 공격 시간을 최대 60%까지 감소시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.