[논문 리뷰] Regional Homogeneity: Towards Learning Transferable Universal Adversarial Perturbations Against Defenses
이 논문은 방어 모델에 대한 이동 가능한 전역 적으로 공격 가능한 공격을 생성하기 위해 공격 편향의 지역적 동질성에 기반한 새로운 방법인 지역적 동질성 편향(RHP)을 제안한다. 경량의 기울기 변환 모듈을 사용하여 과소적합을 유도함으로써, 명시적인 전역 손실 없이도 전역 편향을 생성하며, 9개의 방어 모델에 대해 평균 14.0%의 정확도 저하를 이끌어내어 기존 최고 성능(SOTA) 방법보다 최대 19.2% 향상된 성능을 달성한다.
This paper focuses on learning transferable adversarial examples specifically against defense models (models to defense adversarial attacks). In particular, we show that a simple universal perturbation can fool a series of state-of-the-art defenses. Adversarial examples generated by existing attacks are generally hard to transfer to defense models. We observe the property of regional homogeneity in adversarial perturbations and suggest that the defenses are less robust to regionally homogeneous perturbations. Therefore, we propose an effective transforming paradigm and a customized gradient transformer module to transform existing perturbations into regionally homogeneous ones. Without explicitly forcing the perturbations to be universal, we observe that a well-trained gradient transformer module tends to output input-independent gradients (hence universal) benefiting from the under-fitting phenomenon. Thorough experiments demonstrate that our work significantly outperforms the prior art attacking algorithms (either image-dependent or universal ones) by an average improvement of 14.0% when attacking 9 defenses in the transfer-based attack setting. In addition to the cross-model transferability, we also verify that regionally homogeneous perturbations can well transfer across different vision tasks (attacking with the semantic segmentation task and testing on the object detection task). The code is available here: https://github.com/LiYingwei/Regional-Homogeneity.
연구 동기 및 목표
- 최신 방어 모델에 대해 이동 가능한 적대적 예제를 생성하는 데 도전하는 것.
- 기존의 전역 공격이 방어 모델에 대해 효과적으로 이동하지 못하는 이유를 조사하고, 적대적 편향의 구조적 차이를 규명하는 것.
- 기울기 변환 모듈의 과소적합을 통해 전역 편향을 본질적으로 생성하는 방법을 개발하는 것.
- 제안된 편향의 다중 모델 및 다중 작업 간 이동 가능성을 검증하는 것.
- 지역적 동질성 편향이 표준 노이즈 유형이나 이미지에 의존하는 편향보다 방어 모델에 대해 더 효과적인가를 입증하는 것.
제안 방법
- 기울기 변환 모듈을 사용하여 표준 적대적 편향을 지역적 동질성 편향으로 변환하는 전환적 패러다임을 제안한다.
- 3×3 컨볼루션 레이어와 K개의 지역 파artitions를 사용하여 총 12 + 2K개의 학습 가능한 파rameter를 가진 경량 기울기 변환 모듈을 설계한다.
- 기울기 변환 모듈을 과소적합(고편향, 저분산)하도록 훈련시켜 입력에 의존하지 않는 기울기를 유도함으로써 전역 편향을 생성한다.
- 수직, 수평, 격자, 슬래시 등의 지역 분할 함수를 사용하여 편향 공간 내 국소 상관관계 구조를 정의한다.
- 훈련된 변환 모듈을 적용하여 전역 적대적 예제를 명시적인 이동 가능성 강제 없이 생성한다.
- 세분화에서 검출로의 다중 작업 공격 포함, 다양한 모델 및 작업 간 이동 가능성을 평가한다.
실험 결과
연구 질문
- RQ1표준 전역 적대적 편향이 방어 모델에 대해 효과적으로 이동하지 못하는 이유는 무엇인가?
- RQ2적대적 편향의 지역적 동질성을 활용하여 방어 모델에 대한 이동 가능성을 향상시킬 수 있는가?
- RQ3과소적합으로 훈련된 기울기 변환 모듈이 자연스럽게 전역 적대적 편향을 생성하는가?
- RQ4지역적 동질성 편향은 세분화에서 검출로의 다양한 비전 작업 간 이동 가능성을 가지는가?
- RQ5기존의 전역 및 이미지에 의존하는 공격 방법과 비교하여 제안된 방법의 정량적 성능은 어떻게 되는가?
주요 결과
- RHP는 이동 기반 설정에서 9개의 방어 모델을 공격할 때 기존 기법 대비 평균 14.0% 향상된 공격 성공률을 달성한다.
- RHP는 SOTA 전역 공격인 UAP 대비 19.2% 향상된 상위 1위 오차율 향상과 GAP 대비 15.6% 향상된 성능을 기록한다.
- RHP는 이미지에 의존하는 공격 방식보다도 뛰어나다: FGSM 대비 12.9%, MIM 대비 12.6%, DIM 대비 9.58% 향상된다.
- RHP는 강력한 다중 작업 이동 가능성을 보여주며, 세분화 모델을 공격할 때 Faster R-CNN의 mAP를 69.2에서 31.6으로 감소시킨다.
- 다양한 지역 분할 함수(격자, 슬래시 등)는 유사한 이동 가능성을 보이며, 정성적 증거에 따르면 서로 다른 저수준 시각 패턴을 타겟으로 한다.
- 기울기 변환 모듈은 명시적인 전역 손실이나 최적화 없이도 과소적합을 통해 자연스럽게 전역 행동을 달성한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.