[논문 리뷰] Sparse Adversarial Video Attacks with Spatial Transformations
이 논문은 베이지안 최적화와 SGD를 사용하여 추가 노이즈와 공간 변환(예: 회전, 스케일링)을 동시에 최적화함으로써 가장 영향력 있는 프레임을 식별하는 스파스한 적대적 비디오 공격인 DeepSAVA를 제안한다. 인간의 정신적 인식에 영향을 주지 않으면서도 공격 성공률을 극대화하기 위해 ℓp-노름 대신 구조적 유사도(SSIM)를 사용함으로써, I3D 모델에서 최대 100%의 공격 성공률을 달성하며, 오직 한 프레임만을 변형함으로써 뛰어난 이동성(transferability)을 유지한다.
In recent years, a significant amount of research efforts concentrated on adversarial attacks on images, while adversarial video attacks have seldom been explored. We propose an adversarial attack strategy on videos, called DeepSAVA. Our model includes both additive perturbation and spatial transformation by a unified optimisation framework, where the structural similarity index (SSIM) measure is adopted to measure the adversarial distance. We design an effective and novel optimisation scheme which alternatively utilizes Bayesian optimisation to identify the most influential frame in a video and Stochastic gradient descent (SGD) based optimisation to produce both additive and spatial-transformed perturbations. Doing so enables DeepSAVA to perform a very sparse attack on videos for maintaining human imperceptibility while still achieving state-of-the-art performance in terms of both attack success rate and adversarial transferability. Our intensive experiments on various types of deep neural networks and video datasets confirm the superiority of DeepSAVA.
연구 동기 및 목표
- 높은 성공률을 달성하면서도 인간이 인지하기 어려운 강건한 적대적 비디오 공격 방법의 부족을 해결하기 위해.
- 카메라 흔들림이나 회전과 같은 자연스러운 공간 변환을 반영하지 못하는 ℓp-노름 기반의 충실도 메트릭의 한계를 극복하기 위해.
- 비디오 시퀀스에서 가장 영향력 있는 프레임을 식별하고 이를 변형함으로써 스파스한 공격을 가능하게 하기 위해.
- LSTM, GRU와 같은 순환 아키텍처와 I3D, Inception-v3와 같은 CNN 기반 모델을 포함한 다양한 비디오 모델 간의 적대적 이동성을 향상시키기 위해.
- 더 강력하고 현실적인 적대적 예제를 생성하기 위해 추가 노이즈와 공간 변환을 동시에 학습하는 통합 최적화 프레임워크를 개발하기 위해.
제안 방법
- 추가 노이즈와 공간 변환(예: 회전, 스케일링)을 동시에 최적화하여 공격 성공률을 극대화하고 정신적 인식에 영향을 최소화하는 통합 최적화 프레임워크를 구현한다.
- 베이지안 최적화(BO)를 사용하여 비디오에서 공격 성공률을 가장 높게 만드는 데 기여하는 가장 영향력 있는 프레임을 반복적으로 식별한다.
- 확률적 경사 하강법(SGD)을 사용하여 선택된 프레임에서 추가 노이즈와 공간 변환 파라미터를 최적화한다.
- 구조적 유사도 지수 측정법(SSIM)을 주요 메트릭으로 사용하여 적대적 거리를 평가함으로써 ℓp-노름 대비 정신적 충실도를 확보한다.
- 효율성과 효과성을 균형 잡기 위해 BO 기반의 프레임 선택과 SGD 기반의 변형 생성을 번갈아 적용한다.
- I3D, Inception-v3, LSTM, GRU, 그리고 일반적인 RNN을 포함한 여러 모델을 사용하여 UCF101과 HMDB51 데이터셋에서 평가한다.
실험 결과
연구 질문
- RQ1추가 노이즈와 공간 변환을 동시에 통합 최적화 프레임워크로 조합함으로써 더 현실적이고 효과적인 적대적 비디오 공격를 생성할 수 있는가?
- RQ2ℓp-노름 대신 SSIM을 충실도 메트릭으로 사용할 경우, 실제 세계의 비디오 왜곡을 더 잘 반영하는 정신적으로 자연스러운 적대적 예제를 생성할 수 있는가?
- RQ3베이지안 최적화가 비디오 시퀀스에서 가장 영향력 있는 프레임을 식별하여 높은 성공률을 달성하는 스파스한 공격를 가능하게 할 수 있는가?
- RQ4제안된 방법은 특히 LSTM과 GRU와 같은 순환 아키텍처를 포함한 다양한 비디오 모델 간에 어떻게 이동성을 보이는가?
- RQ5오직 한 프레임만 변형함으로써도 높은 공격 성공률을 달성하면서도 높은 이동성을 유지할 수 있는가?
주요 결과
- DeepSAVA는 비디오의 오직 한 프레임만 변형함으로써 I3D 모델에서 100%의 공격 성공률를 달성하여 뛰어난 스파arsity와 효과성을 입증한다.
- UCF101 데이터셋에서 DeepSAVA는 오직 한 프레임만 변형함으로써 여러 모델에서 99.5%에서 100%의 공격 성공률를 기록하며, 기존 최고 수준의 기준 모델들을 능가한다.
- 이동성 면에서 뛰어난 성능을 보이며, 백박스 LSTM 공격에서 생성된 적대적 예제로 일반 RNN을 공격할 경우, 82.40%의 공격 성공률를 기록하여 기준 모델인 Sparse보다 뛰어난 성능을 보였다.
- LSTM, GRU와 같은 RNN 기반 모델에서 다른 RNN 모델로의 이동성은 약 85%로 매우 높아, 메모리 증강 아키텍처 간의 강건성을 보여준다.
- ℓp-노름 대신 SSIM을 사용함으로써, 회전, 스케일링과 같은 자연스러운 공간 변환에 더 강건한 적대적 예제를 생성할 수 있어 정신적 현실감이 향상되었다.
- Sparse 기준 모델 대비 DeepSAVA는 UCF101의 모든 타겟 모델에서 더 높은 공격 성공률를 기록하였으며, LSTM에서는 85.34%, 일반 RNN에서는 54.62%의 성과를 기록하여 뛰어난 이동성을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.