Skip to main content
QUICK REVIEW

[논문 리뷰] Transferable Adversarial Attacks on Vision Transformers with Token Gradient Regularization

Jianping Zhang, Yizhan Huang|arXiv (Cornell University)|2023. 03. 28.
Adversarial Robustness in Machine Learning인용 수 6
한 줄 요약

이 논문은 비전 트랜스포머(ViTs)에서 중간 블록의 기울기 분산을 줄임으로써 이동 가능한 적대적 공격의 성능을 향상시키는 새로운 방법인 토큰 기울기 정규화(TGR)를 제안한다. TGR는 토큰 수준에서 극단적인 기울기를 제거함으로써 기울기 업데이트 방향을 안정화시켜, ImageNet에서 최신 기술 대비 평균 8.8% 향상된 성능을 달성한다.

ABSTRACT

Vision transformers (ViTs) have been successfully deployed in a variety of computer vision tasks, but they are still vulnerable to adversarial samples. Transfer-based attacks use a local model to generate adversarial samples and directly transfer them to attack a target black-box model. The high efficiency of transfer-based attacks makes it a severe security threat to ViT-based applications. Therefore, it is vital to design effective transfer-based attacks to identify the deficiencies of ViTs beforehand in security-sensitive scenarios. Existing efforts generally focus on regularizing the input gradients to stabilize the updated direction of adversarial samples. However, the variance of the back-propagated gradients in intermediate blocks of ViTs may still be large, which may make the generated adversarial samples focus on some model-specific features and get stuck in poor local optima. To overcome the shortcomings of existing approaches, we propose the Token Gradient Regularization (TGR) method. According to the structural characteristics of ViTs, TGR reduces the variance of the back-propagated gradient in each internal block of ViTs in a token-wise manner and utilizes the regularized gradient to generate adversarial samples. Extensive experiments on attacking both ViTs and CNNs confirm the superiority of our approach. Notably, compared to the state-of-the-art transfer-based attacks, our TGR offers a performance improvement of 8.8% on average.

연구 동기 및 목표

  • 기존의 기울기 정규화 기반 적대적 공격이 비전 트랜스포머(ViTs)에서 이동성에 한계를 가진 문제를 해결하기 위해.
  • 입력 수준의 정규화에도 불구하고 현재 방법들이 중간 블록의 기울기를 안정화하지 못하는 이유를 탐구하기 위해.
  • ViT 블록 내에서 토큰 수준의 기울기 정규화를 통해 적대적 샘플의 이동성을 향상시키기 위해.
  • 타겟 모델에 대한 액세스 없이도 ViTs와 CNNs 양쪽에서 공격 성공률을 향상시키는 방법을 개발하기 위해.

제안 방법

  • TGR는 ViT의 각 내부 블록에서 기울기 값이 극단적인 것을 식별하고 토큰 수준에서 제거한다.
  • 각 패치 임베딩을 토큰으로 간주하고, 중간 레이어에서 각 토큰 표현에 대한 분류 손실의 기울기를 계산한다.
  • 각 토큰당 상위-k개의 절대값 기울기를 기반으로 한 임계값 기반의 프루닝을 적용하여 백프로파게이션 신호의 분산을 줄인다.
  • 정규화된 기울기는 공격 과정 중에 적대적 편향을 업데이트하는 데 사용된다.
  • TGR는 소스 모델에서 화이트박스 공격 단계 동안 적용되며, 그 결과 생성된 적대적 샘플은 직접 블랙박스 타겟 모델로 이동된다.
  • 이 방법은 중간 특징 맵에 동일한 기울기 정규화를 적용함으로써 CNNs에도 응용되어 일반화 능력을 입증한다.

실험 결과

연구 질문

  • RQ1기존의 기울기 정규화 방법들이 입력 기울기 분산을 줄였음에도 불구하고 비전 트랜스포머(ViTs)에서 이동성을 향상시키지 못하는 이유는 무엇인가?
  • RQ2비전 트랜스포머(ViTs)의 중간 블록에서의 기울기 분산이 적대적 샘플의 이동성에 어떤 영향을 미치는가?
  • RQ3ViT 블록 내에서 토큰 수준의 기울기 정규화가 ViTs와 CNNs 양쪽에서 공격 성공률을 얼마나 향상시킬 수 있는가?
  • RQ4성능과 효율성을 균형 잡기 위해 각 토큰당 제거할 최적의 극단적 기울기 수는 얼마인가?
  • RQ5TGR는 비-ViT 아키텍처인 CNNs로 일반화될 수 있는가? 그리고 기존 최신 기술 대비 어떻게 비교되는가?

주요 결과

  • TGR는 다양한 ImageNet 모델에서 최신 기술 대비 평균 8.8% 향상된 공격 성공률을 달성한다.
  • ViT의 깊은 레이어는 기울기 분산이 가장 낮고, 浅층 레이어는 기울기 분산이 가장 높으며, 이는 중간 블록 정규화의 필요성을 확인한다.
  • 특히 얕은 레이어와 중간 레이어에서 기준 방법들인 VMI와 비교해 TGR가 평균 기울기 분산을 더 효과적으로 감소시킨다.
  • 아블레이션 연구 결과, 어텐션 메커니즘이 이동성에 가장 큰 기여를 하며, 그 다음으로 MLP와 QKV 구성 요소가 영향을 미친다.
  • CNNs에 적용했을 경우, TGR는 MIM 대비 공격 성공률을 12.5% 이상 향상시키며, VMI 수준의 성능을 달성하여 일반화 능력을 입증한다.
  • 정규화할 최적의 극단적 토큰 수는 k=1이며, 이 이상으로 k를 늘릴 경우 과도한 기울기 수정으로 인해 이동성이 감소한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.