[논문 리뷰] Understanding Zero-Shot Adversarial Robustness for Large-Scale Models
이 논문은 CLIP와 같은 대규모 시각-언어 모델에서 제로샷 적대적 방어성능을 향상시키기 위해 텍스트 유도형 대비적 적대적 훈련 손실(이하 TeCoA)을 제안한다. 적대적 시각적 특징을 대비 학습을 통해 정확한 텍스트 임베딩과 정렬함으로써 적응 과정 중에 TeCoA는 일반화 능력을 훼손하지 않은 채 방어성을 향상시킨다. 이로 인해 CLIP 대비 15개 데이터셋 평균 31점의 정확도 향상을 달성한다.
Pretrained large-scale vision-language models like CLIP have exhibited strong generalization over unseen tasks. Yet imperceptible adversarial perturbations can significantly reduce CLIP's performance on new tasks. In this work, we identify and explore the problem of \emph{adapting large-scale models for zero-shot adversarial robustness}. We first identify two key factors during model adaption -- training losses and adaptation methods -- that affect the model's zero-shot adversarial robustness. We then propose a text-guided contrastive adversarial training loss, which aligns the text embeddings and the adversarial visual features with contrastive learning on a small set of training data. We apply this training loss to two adaption methods, model finetuning and visual prompt tuning. We find that visual prompt tuning is more effective in the absence of texts, while finetuning wins in the existence of text guidance. Overall, our approach significantly improves the zero-shot adversarial robustness over CLIP, seeing an average improvement of over 31 points over ImageNet and 15 zero-shot datasets. We hope this work can shed light on understanding the zero-shot adversarial robustness of large-scale models.
연구 동기 및 목표
- CLIP와 같은 대규모 시각-언어 모델에서 표준 적대적 훈련이 제로샷 일반화 능력을 해칠 때, 제로샷 적대적 방어성을 달성하는 데 도전하는 것.
- 훈련 손실과 적응 방법이 기초 모델의 제로샷 적대적 방어성에 미치는 영향을 조사하는 것.
- CLIP의 제로샷 능력을 유지하면서도 눈에 띄지 않는 적대적 편향에 대해 훨씬 더 높은 저항성을 확보하는 방법을 개발하는 것.
- 시각-언어 모델에서 제로샷 적대적 방어성에 대한 새로운 벤치마크를 설정하는 것.
제안 방법
- 대비 학습을 활용해 적대적 시각적 특징과 정확한 텍스트 임베딩 간의 유사도를 최대화하는 텍스트 유도형 대비 적대적 훈련 손실(이하 TeCoA)을 제안한다.
- 모델의 미세조정 및 시각 프롬프트 튜닝(VPT) 과정에서 TeCoA를 적용함으로써 전체 모델을 재학습하지 않고도 방어성을 확보한다.
- 소량의 레이블이 있는 데이터를 사용해 적대적 예제를 생성하고, 대비 손실을 통해 그 특징을 해당 텍스트 임베딩과 정렬한다.
- CLIP를 활용해 텍스트 기반 기반에서 허위 레이블을 추출함으로써 TeCoA를 레이블이 없는 데이터로 확장하여 대규모 비라벨 데이터에서의 방어성 향상을 가능하게 한다.
- 이중 최적화 루프를 활용한다: 먼저 대비 손실에 대한 기울기 공격을 통해 적대적 예제를 생성하고, 그 다음 기울기 하강법을 통해 모델 파라미터를 업데이트한다.
- 입력 시퀀스에 학습 가능한 임베딩을 삽입하기 위해 토큰 수준의 시각 프롬프트를 사용한다. 이는 픽셀 수준의 프롬프트보다 더 효과적이다.
실험 결과
연구 질문
- RQ1미세조정과 시각 프롬프트 튜닝이라는 서로 다른 적응 방법이 CLIP의 제로샷 적대적 방어성에 어떤 영향을 미치는가?
- RQ2적대적 시각적 특징을 텍스트 임베딩과 정렬하는 대비 손실이 제로샷 방어성을 향상시키면서 일반화 능력을 떨어뜨리지 않을 수 있는가?
- RQ3텍스트 유도가 존재할 경우 또는 존재하지 않을 경우, 적대적 적응의 효과성에 어떤 영향을 미치는가?
- RQ4TeCoA는 레이블이 없는 데이터에 효과적으로 적용될 수 있는가? 이는 최소한의 감독으로 방어성을 확장할 수 있는가?
주요 결과
- TeCoA는 CLIP 대비 15개 제로샷 데이터셋 평균 31점의 정확도 향상을 통해 제로샷 적대적 방어성을 향상시킨다.
- 텍스트 유도가 없는 조건에서 시각 프롬프트 튜닝(VPT)이 미세조정보다 더 높은 방어성을 달성하며, 더 적은 파라미터로도 성능을 높인다.
- 텍스트 유도가 존재할 경우, TeCoA를 사용한 미세조정이 VPT보다 더 큰 성능 향상을 이룬다. 이는 더 많은 파라미터가 업데이트되기 때문이다.
- 이 방법은 CLIP의 강력한 제로샷 일반화 능력을 유지하면서도 방어성을 크게 향상시키며, 표준 적대적 훈련에서 관찰되는 상충 관계를 피한다.
- HateMemes에서 TeCoA는 54%의 정확도를 기록했고, PCAM에서는 52.5%를 기록하여 무작위 추측 수준에 가까워, 분포 외 작업에서의 도메인 이탈 문제를 시사한다.
- 이 방법은 비라벨 데이터로 일반화 가능하며, 허위 레이블 생성에 이미지-텍스트 유사도만을 사용함으로써 최소한의 감독으로도 방어성 향상을 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.