Skip to main content
QUICK REVIEW

[논문 리뷰] SPARK: Spatial-aware Online Incremental Attack Against Visual Tracking

Qing Guo, Xiaofei Xie|arXiv (Cornell University)|2019. 10. 19.
Adversarial Robustness in Machine Learning참고 문헌 67인용 수 7
한 줄 요약

SPARK는 실시간으로 눈에 띄지 않는, 이동 가능한 왜곡을 생성하여 온라인 시각 객체 추적기를 잘못된 또는 지정된 궤적을 따라 오도시키는 공간 인식 기반의 온라인 증분 공격을 제안한다. $L_{2,1}$ 정규화와 이력 왜곡 피드백을 활용하여 낮은 지연으로 높은 공격 성공률를 달성하며, OTB100, VOT2018, UAV123, LaSOT 벤치마크에서 SiamRPN++와 SiamDW보다 우수한 성능을 보였다.

ABSTRACT

Adversarial attacks of deep neural networks have been intensively studied on image, audio, natural language, patch, and pixel classification tasks. Nevertheless, as a typical, while important real-world application, the adversarial attacks of online video object tracking that traces an object's moving trajectory instead of its category are rarely explored. In this paper, we identify a new task for the adversarial attack to visual tracking: online generating imperceptible perturbations that mislead trackers along an incorrect (Untargeted Attack, UA) or specified trajectory (Targeted Attack, TA). To this end, we first propose a extit{spatial-aware} basic attack by adapting existing attack methods, i.e., FGSM, BIM, and C&W, and comprehensively analyze the attacking performance. We identify that online object tracking poses two new challenges: 1) it is difficult to generate imperceptible perturbations that can transfer across frames, and 2) real-time trackers require the attack to satisfy a certain level of efficiency. To address these challenges, we further propose the spatial-aware online incremental attack (a.k.a. SPARK) that performs spatial-temporal sparse incremental perturbations online and makes the adversarial attack less perceptible. In addition, as an optimization-based method, SPARK quickly converges to very small losses within several iterations by considering historical incremental perturbations, making it much more efficient than basic attacks. The in-depth evaluation on state-of-the-art trackers (i.e., SiamRPN++ with AlexNet, MobileNetv2, and ResNet-50, and SiamDW) on OTB100, VOT2018, UAV123, and LaSOT demonstrates the effectiveness and transferability of SPARK in misleading the trackers under both UA and TA with minor perturbations.

연구 동기 및 목표

  • 자율 시스템에서 중요한 실생활 응용 분야인 온라인 시각 객체 추적에 대한 적대적 공격 연구의 부족을 해결하기 위해.
  • 공격의 고유한 과제를 규명하기 위해: 제한된 시간적 맥락, 프레임 단위 처리, 실시간 효율성 제약.
  • 눈에 띄이지 않으며 이동성이 높은, 프레임 간 및 추적기 간 유지되는 효율적인 온라인 증분 공격을 개발하기 위해.
  • 다양한 벤치마크 데이터셋에서 최신 추적기들을 대상으로 비타겟 및 타겟 공격 설정에서 성능을 평가하기 위해.

제안 방법

  • FGSM, BIM, C&W 공격 방법을 프레임 단위 적대적 왜곡 생성을 위한 공간 인식 기반 기본 공격으로 변형한다.
  • SPARK를 도입하여 $L_{2,1}$ 정규화를 사용한 시공간 희소 증분 왜곡을 적용하는 최적화 기반 방법을 개발하여 이동성 향상과 시각적 인식 가능성 감소를 달성한다.
  • 이전 공격 결과를 최적화 과정에 통합하여 수렴 속도 향상과 효율성 향상을 도모한다.
  • 기울기 기반 최적화를 사용하는 화이트박스 공격 설정을 적용하여 각 프레임마다 왜곡을 반복적으로 업데이트함으로써 시퀀스 간 일관성을 유지한다.
  • 경량 모델(예: SiamRPN-AlexNet)에서 왜곡을 생성하고 이를 무거운 모델(예: MobileNetV2, ResNet-50)에 적용하여 공격 시간을 줄이기 위해 이동성을 활용한다.
  • 다중 해상도 공간 주의 메커니즘을 사용하여 특징이 뚜렷하고 운동 민감한 영역에 왜곡을 집중시켜 추적 방해를 극대화한다.

실험 결과

연구 질문

  • RQ1눈에 띄이지 않는 온라인 증분 적대적 왜곡이 실시간 시각 추적기를 잘못된 또는 타겟된 궤적을 따라 효과적으로 오도시킬 수 있는가?
  • RQ2SPARK의 이력 왜곡 피드백 사용이 표준 반복 공격 대비 공격 효율성과 수렴 속도 향상에 어떤 영향을 미치는가?
  • RQ3SPARK의 공간 인식 왜곡 설계가 다양한 추적 모델과 데이터셋 간의 이동성 향상에 어느 정도 기여하는가?
  • RQ4SPARK는 계산 비용이 높은 추적기에서도 거의 실시간으로 작동하면서도 높은 공격 성공률를 유지할 수 있는가?

주요 결과

  • SiamRPN-AlexNet에서 SPARK는 24.3 fps의 공격 속도를 달성하여 온라인 추적 시스템에 적합한 거의 실시간 성능을 확보했다.
  • OTB100 데이터셋에서 SPARK는 SiamRPN++(ResNet-50)의 정밀도를 비타겟 공격 시 85.6%에서 42.1%로 감소시켜 높은 공격 성공률를 입증했다.
  • SiamDW에 대해서도 SPARK는 비타겟 공격 시 정밀도를 87.3%에서 41.2%로 감소시켜 다양한 아키텍처에서의 효과성을 확인했다.
  • 공격는 높은 이동성을 유지한다: SiamRPN-AlexNet에서 생성된 왜곡은 최소한의 재학습으로 MobileNetV2 및 ResNet-50 변종에서 성능 저하를 유도했다.
  • VOT2018 및 LaSOT 벤치마크에서 비타겟 설정에서 SPARK는 90%의 공격 성공률를 기록하여 기준 FGSM, BIM, C&W 방법을 모두 능가했다.
  • 이력 왜곡 피드백과 $L_{2,1}$ 정규화를 활용함으로써 표준 반복 공격 대비 공격 시간을 최대 60%까지 감소시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.