[논문 리뷰] Benchmarking Zero-Shot Robustness of Multimodal Foundation Models: A Pilot Study
이 논문은 CLIP와 같은 다중모odal 기초모델의 제로샷 강건성 평가를 위한 종합적 벤치마크인 RoZ를 소개한다. 이는 자연 분포 이탈 7종, 합성 분포 이탈 3종, 그리고 악성 공격 11종을 포함한다. 강력한 제로샷 정확도에도 불구하고 CLIP는 합성 이탈에서 평균 -11.8%의 강건성 저하를 보이며, 문체적 공격에서는 -34.7%에 이르게 되어, 감독 학습 기반 ImageNet 모델과 비교해 심각한 강건성 격차를 드러낸다.
Pre-training image representations from the raw text about images enables zero-shot vision transfer to downstream tasks. Through pre-training on millions of samples collected from the internet, multimodal foundation models, such as CLIP, produce state-of-the-art zero-shot results that often reach competitiveness with fully supervised methods without the need for task-specific training. Besides the encouraging performance on classification accuracy, it is reported that these models close the robustness gap by matching the performance of supervised models trained on ImageNet under natural distribution shift. Because robustness is critical to real-world applications, especially safety-critical ones, in this paper, we present a comprehensive evaluation based on a large-scale robustness benchmark covering 7 natural, 3 synthetic distribution shifts, and 11 adversarial attacks. We use CLIP as a pilot study. We show that CLIP leads to a significant robustness drop compared to supervised ImageNet models on our benchmark, especially under synthetic distribution shift and adversarial attacks. Furthermore, data overlap analysis suggests that the observed robustness under natural distribution shifts could be attributed, at least in part, to data overlap. In summary, our evaluation shows a comprehensive evaluation of robustness is necessary; and there is a significant need to improve the robustness of zero-shot multimodal models.
연구 동기 및 목표
- 자연 분포 이탈을 초월해 제로샷 다중모달 기초모델의 강건성을 체계적으로 평가하기 위해.
- 자연 분포 이탈에서 관찰된 강건성이 데이터 오버랩 때문인지 진정으로 일반화된 모델 성능인지 파악하기 위해.
- 자연, 합성, 악성 강건성 평가를 포함한 종합적 벤치마크(RoZ)를 개발하기 위해.
- 프롬프트 엔지니어링 및 자동 프롬프트 생성이 제로샷 환경에서 강건성에 어떤 영향을 미치는지 평가하기 위해.
- 안전 중심 응용 분야에서 제로샷 다중모달 모델의 강건성 향상이 급한 필요성이 있음을 부각하기 위해.
제안 방법
- 자연 분포 이탈 7종(예: ImageNet-V2, ObjectNet), 합성 이탈 3종(예: ImageNet-C, Stylized ImageNet), 악성 공격 11종을 포함한 RoZ 벤치마크를 구축하였다.
- ViT-B/16, ResNet50x16 등의 다양한 비전 인코더를 사용해 CLIP를 평가하였으며, 자동 프롬프트 생성을 사용하는 CLIP-Auto도 평가하였다.
- 테스트 세트와 ImageNet 간의 데이터 오버랩 분석을 수행하여, 자연 분포 이탈에서의 강건성이 데이터 오버랩 때문인지 평가하였다.
- 프롬프트 기반 추론에서 다중모달 모델의 취약점을 노출시키기 위해 새로운 문체적 공격 테스트 세트(ImageNet-T, CIFAR-10-T)를 도입하였다.
- 모든 강건성 조건 하에서 제로샷 CLIP 성능을 표준 ImageNet 모델과 비교하였다.
- 피팅 튜닝 없이 자연어 템플릿을 사용한 표준화된 제로샷 프롬프팅을 통해 모델 일반화 능력을 평가하였다.

실험 결과
연구 질문
- RQ1CLIP는 감독 학습 기반 ImageNet 모델과 비교해 합성 분포 이탈 및 악성 공격 상황에서 얼마나 강건한가?
- RQ2자연 분포 이탈에서 관찰된 CLIP의 강건성은 ImageNet 학습 세트와의 데이터 오버랩 때문인가?
- RQ3자동 프롬프트 생성(CLIP-Auto)은 표준 CLIP 및 감독 모델 대비 강건성에 어떤 영향을 미치는가?
- RQ4문체적 변형과 같은 새로운 악성 공격 상황에서 다중모달 제로샷 모델에 드러나는 취약점은 무엇인가?
- RQ5RoZ와 같은 종합적 벤치마크는 제로샷 다중모달 기초모델의 강건성 취약점을 신뢰성 있게 식별할 수 있는가?
주요 결과
- CLIP는 합성 분포 이탈(예: ImageNet-C, Stylized ImageNet)에서 감독 학습 기반 ImageNet 모델 대비 평균 -11.8%의 강건성 저하를 보였다.
- 악성 공격 상황에서는 CLIP가 표준 ImageNet 모델보다 열등하며, 신규 도입된 문체적 공격 세트(ImageNet-T 및 CIFAR-10-T)에서 -34.7%의 강건성 저하를 보였다.
- 데이터 오버랩 분석 결과, 자연 분포 이탈에서 관찰된 강건성(예: ImageNet-A, ImageNet-R)은 적어도 일부는 ImageNet 학습 세트와의 겹침 때문임을 확인하였다.
- 자동 프롬프트 생성을 사용하는 CLIP-Auto는 모든 테스트 세트에서 표준 CLIP와 유사한 성능을 보였으며, 이는 프롬프트 자동화로 인한 강건성 향상이 없음을 시사한다.
- 강력한 제로샷 정확도에도 불구하고 CLIP는 비자연 분포 이탈 상황에서는 일반화된 강건성이 떨어지며, 실세계 적용에서 심각한 취약점을 드러낸다.
- RoZ 벤치마크는 제로샷 다중모달 모델의 강건성 취약점을 성공적으로 식별하였으며, 표준 제로샷 정확도를 초월한 체계적 강건성 평가의 필요성을 입증하였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.