Skip to main content
QUICK REVIEW

[논문 리뷰] Image Hijacks: Adversarial Images can Control Generative Models at Runtime

Luke Bailey, Euan Ong|arXiv (Cornell University)|2023. 09. 01.
Adversarial Robustness in Machine Learning인용 수 4
한 줄 요약

이 논문은 CLIP와 LLaMA-2를 기반으로 하는 최신 비전-언어 모델(LaVA)에서 추론 시점에 모델의 생성 출력을 조작하는 악성 이미지인 이미지 히잡스(image hijacks)를 소개한다. 저자들은 새로운 방법인 행동 매칭(Behaviour Matching)을 사용하여, 인식 불가능한 이미지 변형을 생성함으로써 LLaVA에서 임의의 텍스트 출력을 유도하거나, 컨텍스트를 泄露하거나, 안전성 보호 장치를 우회하는 데 90% 이상의 성공률를 달성한다.

ABSTRACT

Are foundation models secure against malicious actors? In this work, we focus on the image input to a vision-language model (VLM). We discover image hijacks, adversarial images that control the behaviour of VLMs at inference time, and introduce the general Behaviour Matching algorithm for training image hijacks. From this, we derive the Prompt Matching method, allowing us to train hijacks matching the behaviour of an arbitrary user-defined text prompt (e.g. 'the Eiffel Tower is now located in Rome') using a generic, off-the-shelf dataset unrelated to our choice of prompt. We use Behaviour Matching to craft hijacks for four types of attack, forcing VLMs to generate outputs of the adversary's choice, leak information from their context window, override their safety training, and believe false statements. We study these attacks against LLaVA, a state-of-the-art VLM based on CLIP and LLaMA-2, and find that all attack types achieve a success rate of over 80%. Moreover, our attacks are automated and require only small image perturbations.

연구 동기 및 목표

  • 신뢰할 수 없는 이미지 입력이 추론 시점에 비전-언어 모델(VLMs)의 동작을 악용당할 수 있는지 조사하기 위해.
  • 비전-언어 모델의 출력을 미세 조절할 수 있는 일반적이고 자동화된 악성 이미지 생성 방법을 개발하기 위해.
  • 다양한 변형 제약 조건 하에서 이러한 공격의 강건성과 실제 적용 가능성 평가하기 위해.
  • 이미지 히잡스가 안전성 훈련을 우회하고, 컨텍스트를 泄露하며, 임의의 출력을 강제로 유도할 수 있는지 보여주기 위해.
  • 실제 환경에 배포된 다중모odal 기초 모델의 보안 위험에 대한 인식 제고를 위해.

제안 방법

  • 입력 텍스트에 관계없이 원하는 행동을 모델 출력과 일치시키기 위해 이미지 변형을 최적화하는 훈련 프레임워크인 행동 매칭(Behaviour Matching)을 제안한다.
  • 특정 출력 행동(예: 임의의 문자열 생성, 안전 제약 우회)을 목표로 하여 이미지 공간에서 경사 하강법을 사용해 이미지 히잡스를 훈련한다.
  • 실제 공격 시나리오를 시뮬레이션하기 위해 세 가지 다른 변형 제약 조건(ℓ∞-노름 제한, 정적 패치, 이동 패치)에 적용한다.
  • 공격자가 VLM의 아키텍처와 파라미터에 완전히 접근할 수 있는 화이트박스 위협 모델을 사용하여 강건한 공격를 생성한다.
  • 목표 행동을 특정 출력 문자열(특정 문자열 공격), 반복된 컨텍스트(컨텍스트 泄露 공격), 유해 지시에 대한 준수(잠금 해제 공격)로 정의한다.
  • 이미지 입력이 텍스트 프롬프트가 다양하거나 악성일지라도 모델 출력을 지배하도록 비전-언어 모델의 어텐션 메커니즘을 활용한다.
Figure 1: Image hijacks of LLaVA, a VLM based on CLIP and LLaMA-2. These attacks are created automatically, control the model’s output, and are barely perceptibe to humans.
Figure 1: Image hijacks of LLaVA, a VLM based on CLIP and LLaMA-2. These attacks are created automatically, control the model’s output, and are barely perceptibe to humans.

실험 결과

연구 질문

  • RQ1입력 텍스트에 관계없이 추론 시점에 악성 이미지를 사용해 비전-언어 모델의 생성 출력을 제어할 수 있는가?
  • RQ2ℓ∞-노름, 정적 패치, 이동 패치와 같은 다양한 변형 제약 조건 하에서 이미지 히잡스의 효과성은 어떠한가?
  • RQ3이미지 히잡스는 모델의 안전성 훈련을 우회하고, 해로운 또는 의도하지 않은 콘텐츠를 생성하도록 유도할 수 있는가?
  • RQ4이미지 히잡스는 모델의 컨텍스트 윈도우에 포함된 정보를 출력으로 유출할 정도로 어느 정도의 정도까지 영향을 미치는가?
  • RQ5이미지 히잡스는 강건하고 자동화되며 인간에게 인식 불가능하여 실제 환경에서 실현 가능한 위협인가?

주요 결과

  • 이미지 히잡스는 LLaVA LLaMA-2-13B-Chat 모델에서 특정 문자열, 컨텍스트 泄露, 잠금 해제 공격의 세 가지 공격 유형 모두에서 90% 이상의 성공률를 기록한다.
  • 공격는 자동화되어 있으며, 매우 작은 ℓ∞-노름 변형(예: 16/255)만으로도 인간에게 인식 불가능하다.
  • 행동 매칭 방법은 입력 텍스트 프롬프트의 변화에 관계없이 강건하게 작동하여 모델 출력에 일관된 제어를 가능하게 한다.
  • 컨텍스트 泄露 공격는 VLM이 입력 컨텍스트를 API 호출로 감싸서 반복적으로 출력하도록 유도함으로써, 새로운 형태의 정보 유출을 입증한다.
  • 정적 패치 및 이동 패치 제약 조건 하에서도 공격가 효과를 유지함으로써, 동적 또는 제약 조건이 있는 입력 환경에서의 실제 적용 가능성을 시사한다.
  • 현재의 악성 공격에 대한 강건성 기법은 이러한 공격에 대해 거의 방어 효과를 가지지 않으며, 이미지 히잡스가 향후 수년간 지속적인 위협으로 남을 수 있음을 시사한다.
Figure 2: Our Behaviour Matching algorithm. Given a dataset of bad behaviour and a frozen VLM, we use Equation 2 to optimise an image so that the VLM output matches the behaviour.
Figure 2: Our Behaviour Matching algorithm. Given a dataset of bad behaviour and a frozen VLM, we use Equation 2 to optimise an image so that the VLM output matches the behaviour.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.