[논문 리뷰] Black-box Targeted Adversarial Attack on Segment Anything (SAM)
이 논문은 프롬프트 의존성을 회피하기 위해 이미지 인코더만 공격하는 Segment Anything Model(SAM)에 대한 블랙박스 타겟화된 적대적 공격(PATA++)을 제안한다. 특징 우세도를 향상시키기 위해 새로운 정규화 손실을 도입하여, 교차 모델 전이성과 블랙박스 환경에서의 타겟 마스크 생성 성능을 크게 향상시켰다.
Deep recognition models are widely vulnerable to adversarial examples, which change the model output by adding quasi-imperceptible perturbation to the image input. Recently, Segment Anything Model (SAM) has emerged to become a popular foundation model in computer vision due to its impressive generalization to unseen data and tasks. Realizing flexible attacks on SAM is beneficial for understanding the robustness of SAM in the adversarial context. To this end, this work aims to achieve a targeted adversarial attack (TAA) on SAM. Specifically, under a certain prompt, the goal is to make the predicted mask of an adversarial example resemble that of a given target image. The task of TAA on SAM has been realized in a recent arXiv work in the white-box setup by assuming access to prompt and model, which is thus less practical. To address the issue of prompt dependence, we propose a simple yet effective approach by only attacking the image encoder. Moreover, we propose a novel regularization loss to enhance the cross-model transferability by increasing the feature dominance of adversarial images over random natural images. Extensive experiments verify the effectiveness of our proposed simple techniques to conduct a successful black-box TAA on SAM.
연구 동기 및 목표
- 모델 또는 프롬프트에 대한 액세스 없이 실용적인 블랙박스 환경에서 Segment Anything Model(SAM)의 적대적 견고성을 조사하기 위해.
- 특정 프롬프트 유형에 의존하지 않도록 하여 엔드 투 엔드 공격에서의 교차 프롬프트 전이성 문제를 해결하기 위해.
- 자연 이미지 대비 적대적 이미지의 상대적 특징 강도를 향상시켜 적대적 예제의 교차 모델 전이성을 향상시키기 위해.
- 높은 마스크 유사도를 유지하면서 프롬프트에 종속되지 않은 효과적이고 전이 가능한 타겟 공격 방법을 개발하기 위해.
제안 방법
- 프롬프트에 종속되지 않는 타겟 공격(PATA)을 제안하여 이미지 인코더만 공격하고 프롬프트 특화 최적화에 의존하지 않도록 한다.
- 적대적 이미지의 특징 우세도를 높이기 위해 새로운 정규화 손실을 도입하여 전이성을 향상시킨다.
- 외부 데이터에 의존하는 것을 방지하기 위해 기존 정상 이미지에서 잘라낸 무작위 패치를 기준 자연 이미지로 대체한다.
- 반복적 FGSM 기반 최적화(e.g., TI-FGSM)에 정규화 손실을 결합하여 적대적 편향을 생성한다.
- ViT-B를 서rogate 모델로 사용하여 ViT-L 및 ViT-H 버전에 대한 적대적 예제를 생성하기 위해 블랙박스 설정에서 공격을 적용한다.
- 점 프롬프트 및 상자 프롬프트 모두에서 예측 마스크와 타겟 마스크 간의 교차율(IoU)을 최적화한다.
실험 결과
연구 질문
- RQ1모델나 프롬프트에 대한 액세스 없이 SAM에 대해 블랙박스 환경에서 타겟 공격을 성공적으로 수행할 수 있는가?
- RQ2엔드 투 엔드 공격과 비교해 이미지 인코더만 공격하는 것이 교차 프롬프트 및 교차 모델 전이성에 기여하는가?
- RQ3상대적 특징 강도는 다양한 SAM 버전 간 적대적 예제의 전이성에 어떤 영향을 미치는가?
- RQ4특징 우세도를 향상시키는 정규화 손실이 SAM에 대한 블랙박스 타겟 공격 성능을 상당히 향상시킬 수 있는가?
주요 결과
- PATA++는 블랙박스 교차 모델 공격에서 ViT-L에서 평균 IoU 30.92%, ViT-H에서 26.58%를 기록하여 기준 PATA를 능가한다.
- 제안된 정규화 손실은 전이성을 유의미하게 향상시키며, IoU는 PATA의 26.36%/22.78%에서 PATA++의 30.92%/26.58%로 상승한다.
- PATA++에 TI-FGSM을 결합하면 성능이 더욱 향상되어 ViT-L에서 33.53%, ViT-H에서 30.16%의 IoU를 달성한다.
- 정규화 손실은 MI-FGSM보다 더 효과적이며, 놀랍게도 MI-FGSM은 전이성을 감소시키는 경향이 있는데, 이는 낮은 특징 우세도 때문일 수 있다.
- 편향 예산과 성능 간 강한 정적 상관관계가 있으며, ε=4/255일 때 IoU는 22.03%/20.07%에서 ε=16/255일 때 41.73%/35.17%로 증가한다.
- 정성적 결과에서는 PATA++가 점 프롬프트 및 상자 프롬프트 모두에서 타겟 마스크와 유사한 적대적 마스크를 성공적으로 생성하는 것으로 나타났다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.