[논문 리뷰] Adversarial Token Attacks on Vision Transformers
이 논문은 비전 트랜스포머(ViTs)를 대상으로 블록 스퍼스, 패치 기반의 적대적 공격을 제안하며, 특정 이미지 패치를 변형함으로써 ViTs가 ResNets보다 훨씬 더 이러한 토큰 수준의 공격에 취약하다는 것을 드러낸다. 단지 1%의 픽셀만으로도 강건한 정확도가 거의 0에 수렴한다. 이 방법은 ViTs가 현실적이고 희박하며 구조적인 공격에 대해 ResNets와 MLP-Mixer보다 덜 강건하다는 것을 입증하며, 기존의 $ε$-제한된 공격에서 ViT의 강건성에 대한 주장에 도전한다.
Vision transformers rely on a patch token based self attention mechanism, in contrast to convolutional networks. We investigate fundamental differences between these two families of models, by designing a block sparsity based adversarial token attack. We probe and analyze transformer as well as convolutional models with token attacks of varying patch sizes. We infer that transformer models are more sensitive to token attacks than convolutional models, with ResNets outperforming Transformer models by up to $\sim30\%$ in robust accuracy for single token attacks.
연구 동기 및 목표
- 비전 트랜스포머(ViTs)와 기타 아키텍처가 토큰 수준에서 표적화되고 구조적인 편향을 받는 공격에 얼마나 강건한지 조사하기 위해.
- 실제 세계의 적대적 위협을 이해하는 데의 격차를 메우기 위해 물리적 패치 공격을 모방하는 실용적인 블록 스퍼스 공격을 설계하기 위해.
- 자기주의 어텐션 메커니즘이 희박하고 국소적인 토큰 조작에 민감하다는 점을 입증함으로써, 기존의 ViT 강건성 주장에 도전하기 위해.
- 다양한 패치 크기와 예산을 고려하여 동일한 토큰 공격 조건 하에서 ViT, DeIT, ResNets, WideResNet, 그리고 MLP-Mixer의 성능을 비교하기 위해.
제안 방법
- 강렬한 오차를 최대화하기 위해 기울기 크기를 기반으로 비중첩 이미지 패치(토큰)를 수정함으로써 블록 스퍼스 적대적 공격을 제안한다.
- 공격 가능한 토큰의 수를 제한하는 토큰 예산 제약 조건을 도입하여 현실적인 희박한 공격을 시뮬레이션한다.
- 표적화되고 효율적인 공격 성공을 보장하기 위해 기울기 기반의 중요도 지도를 사용하여 영향력 있는 패치를 식별한다.
- 고정된 $ε$-제한된 $Ø∞$ 노름을 픽셀당 적용하여 혼합-노름 설정으로 공격을 확장함으로써 간혹성과 강건성의 정도를 평가한다.
- 다양한 패치 크기와 토큰 예산 하에서 ViT, DeIT, ResNet, WideResNet, 그리고 MLP-Mixer 등 여러 아키텍처에 공격을 적용한다.
- 공격 강도와 현실성의 비교를 위해 희박한(1x1 픽셀) 및 블록 스퍼스(16x16 패치) 제약 조건 하에서의 강건한 정확도를 평가한다.
실험 결과
연구 질문
- RQ1실제 위협 모델 하에서 비전 트랜스포머는 컨볼루션 네트워크인 ResNets보다 구조적이고 패치 기반의 공격에 더 취약한가?
- RQ2블록 스퍼스 공격에서 패치 크기와 토큰 예산이 증가함에 따라 ViT와 기타 아키텍처의 강건성은 어떻게 변화하는가?
- RQ3기존 연구에서 ViT가 $ε$-제한된 공격 하에서 ResNets보다 더 강건하다고 주장하는 이유는 무엇이며, 이는 토큰 수준의 공격 하에서도 유지되는가?
- RQ4ViT는 작은 국소적 편향을 보완할 수 있는가, 그리고 어느 정도의 규모에서 그 취약성이 두드러지게 드러나는가?
- RQ5디스틸레이션 또는 아키텍처 설계(예: MLP-Mixer)는 토큰 기반 공격 하에서 강건성에 어떤 영향을 미치는가?
주요 결과
- 단일 토큰 공격의 경우, ResNets는 ViT보다 최대 약 30% 높은 강건한 정확도를 기록하여 ViT가 개별 토큰 조작에 훨씬 더 민감하다는 것을 시사한다.
- 단지 1%의 픽셀만 변형된 경우(이미지넷 기준 256픽셀), ViT-224의 강건한 정확도는 16×16 패치 공격 하에서 13.62%로 떨어지지만, ResNet-101은 동일 조건에서 49.50%의 강건한 정확도를 유지한다.
- 패치 크기가 모델의 토큰 크기와 일치할 경우, ViT와 DeIT는 거의 0에 수렴하는 강건한 정확도(예: ViT-384의 경우 4.98%)를 보이며, ResNets는 여전히 32.89%의 강건한 정확도를 유지한다.
- 더 큰 패치 공격 하에서 MLP-Mixer는 ViT보다 강건성 면에서 뛰어나며, 이는 어텐션 메커니즘이 강건성을 보장하지는 않는다는 것을 시사한다.
- 이 연구는 기존의 $ε$-제한된 공격 하에서 ViT의 강건성 주장이 현실적이고 구조적인 토큰 공격 하에서는 오해의 소지가 있음을 드러낸다.
- 희박한 공격(1×1 픽셀)은 동일한 희박성 예산 하에서 패치 공격보다 강력하지만, 패치 공격은 더 현실적이며 ViT의 더 깊은 아키텍처적 취약성을 드러낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.