[논문 리뷰] How Many Unicorns Are in This Image? A Safety Evaluation Benchmark for Vision LLMs
이 논문은 시각-언어 대규모 모델(VLLMs)을 위한 종합적인 안전 평가 벤치마크를 소개한다. 이는 외부 분포(OOD) 일반화와 악성 공격에 대한 강건성을 평가하기 위해 두 가지 새로운 VQA 데이터셋—OODCV-VQA와 Sketchy-VQA—및 시각 및 언어 모듈에 대한 타겟 공격을 포함한다. 주요 발견은 VLLMs가 OOD 시각 입력을 잘 해석하지만 OOD 텍스트 변형에서는 실패하며, 시각 인코더 공격에 취약하고, 시각-언어 사전학습으로 인해 안전 프로토콜이 약화된다는 것이다.
This work focuses on the potential of Vision LLMs (VLLMs) in visual reasoning. Different from prior studies, we shift our focus from evaluating standard performance to introducing a comprehensive safety evaluation suite, covering both out-of-distribution (OOD) generalization and adversarial robustness. For the OOD evaluation, we present two novel VQA datasets, each with one variant, designed to test model performance under challenging conditions. In exploring adversarial robustness, we propose a straightforward attack strategy for misleading VLLMs to produce visual-unrelated responses. Moreover, we assess the efficacy of two jailbreaking strategies, targeting either the vision or language component of VLLMs. Our evaluation of 21 diverse models, ranging from open-source VLLMs to GPT-4V, yields interesting observations: 1) Current VLLMs struggle with OOD texts but not images, unless the visual information is limited; and 2) These VLLMs can be easily misled by deceiving vision encoders only, and their vision-language training often compromise safety protocols. We release this safety evaluation suite at https://github.com/UCSC-VLAA/vllm-safety-benchmark.
연구 동기 및 목표
- 시각 LLM에서의 체계적 안전 평가 부족, 특히 OOD 일반화와 악성 공격에 대한 강건성 측면에서의 문제를 해결하기 위해.
- 다양한 실패 유형, 예를 들어 시각적 및 텍스트적 변형을 포함한 VLLM 안전성 테스트를 위한 종합적인 벤치마크를 개발하기 위해.
- 시각-언어 사전학습이 정렬된 LLM의 안전 프로토콜을 어떻게 약화시키는지 조사하기 위해.
- 시각 또는 언어 모odalities를 대상으로 하는 재편성 공격의 효과성을 평가하기 위해.
- 특히 오픈소스 및 클로즈드소스 모델에서 VLLM 안전성에 영향을 주는 아키텍처 및 훈련 설계 요소를 특정하기 위해.
제안 방법
- 희귀 시각적 개념과 반사적 기술적 기술을 사용하여 OOD 일반화를 테스트하기 위해 새로운 OOD VQA 데이터셋 두 개—OODCV-VQA와 Sketchy-VQA—를 제안하였다.
- CLIP 시각 인코더를 공격하기 위한 단순하지만 효과적인 전략을 설계하여, 관련이 없는 텍스트 객체와 일치시켜 VLLM의 출력을 오도시켰다.
- 백색 상자 및 전이 공격을 포함한 두 가지 재편성 전략을 평가하여, 독성 지시어 유도 능력을 평가하였다.
- 21개의 모델, 오픈소스 VLLM 및 GPT-4V를 포함하여, 다양한 OOD 시나리오와 공격 유형에서 광범위한 평가를 수행하였다.
- 안전성과 관련된 설계 요소를 분리하기 위해, 다양한 LLM 아키텍처, 시각 인코더, 파인튜닝 설정에서의 모델 성능을 분석하였다.
- 재현 가능성과 향후 연구를 위해, 데이터셋과 코드를 포함한 벤치마크 세트를 공개하였다.
실험 결과
연구 질문
- RQ1언어 입력이 반사적 방식으로 변형되었을 때, 특히 언어 입력이 반사적일 경우 VLLMs는 외부 분포(Out-of-Distribution, OOD) 시각적 입력과 텍스트 입력에서 어떻게 성능을 발휘하는가?
- RQ2CLIP ViT 기반의 단순한 시각 인코더 공격이 VLLM의 출력을 오도시켜 관련 없거나 잘못된 응답을 생성하는 데 효과적인가?
- RQ3언어 프롬프트를 수정하지 않고도 시각 입력만 조작함으로써 재편성 공격이 얼마나 효과적으로 작용할 수 있는가?
- RQ4왜 시각-언어 사전학습 절차가 정렬된 LLM에서 안전 프로토콜을 약화시키며, 이는 모델 행동에 어떤 영향을 미치는가?
- RQ5모델 규모, 시각 인코더 유형, 데이터 다양성과 같은 아키텍처 및 훈련 선택 사항 중에서 VLLM 안전성에 가장 크게 영향을 주는 요소는 무엇인가?
주요 결과
- VLLMs는 이상한 질감, 자세, 형태 등의 OOD 시각적 입력에서 강력한 성능를 보이지만, 언어 입력이 반사적으로 변형되었을 경우에 크게 어려움을 겪는다.
- GPT-4V 및 오픈소스 VLLMs는 다른 모델보다 시각 인코더 공격에서 33.5% 낮은 공격 성공률(ASR)을 보이며, 안전 메커니즘이 활성화된 경우 더 강한 저항성을 보임을 시사한다.
- 스케치 기반 이미지는 주요 과제를 유발한다: 단순한 예/아니요 질문조차도 높은 오류율을 보이며, GPT-4V와 같은 모델은 기본 인식 작업에서 실패한다.
- 단순한 CLIP ViT 기반 공격이 앙상블 기반 공격과 비교해 유사하거나 더 강력한 성공률을 기록함으로써, 시각 인코더 조작만으로도 매우 효과적인 공격이 가능하다는 점을 보여준다.
- 시각-언어 사전학습은 항상 LLM의 안전 프로토콜을 약화시키며, 표준 데이터셋으로 훈련된 모델는 악성 입력에 노출되었을 때 독성 또는 관련 없는 응답을 거부하지 못한다.
- InstructBLIP은 유사한 아키텍처임에도 불구하고 13개의 다양한 시각-언어 데이터셋을 사용함으로써 MiniGPT4를 능가한다. 이는 데이터 다양성과 품질이 안전성과 강건성에 결정적인 역할을 한다는 점을 강조한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.