Skip to main content
QUICK REVIEW

[논문 리뷰] Inducing High Energy-Latency of Large Vision-Language Models with Verbose Images

Kuofeng Gao, Yang Bai|arXiv (Cornell University)|2024. 01. 20.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

이 논문은 추론 중에 대규모 비전-언어 모델(VLM)이 과도하게 길고 복잡하며 다양한 텍스트 시퀀스를 생성하도록 유도하는 인식 불가능한 적대적 편향을 갖춘 '보수적인 이미지(_verbose images_)'를 제안한다. 세 가지 손실 목표를 통해 종료 시퀀스(EOS) 토큰의 생성을 지연시키고, 토큰 수준의 불확실성을 높이며, 시퀀스 수준의 다양성을 증가시킴으로써, 여러 VLM에서 ImageNet에서는 최대 8.56배, MS-COCO에서는 최대 7.87배의 에너지 소비와 지연 시간 증가를 유도한다. 이는 새로운 가용성 기반의 회피 공격임을 입증한다.

ABSTRACT

Large vision-language models (VLMs) such as GPT-4 have achieved exceptional performance across various multi-modal tasks. However, the deployment of VLMs necessitates substantial energy consumption and computational resources. Once attackers maliciously induce high energy consumption and latency time (energy-latency cost) during inference of VLMs, it will exhaust computational resources. In this paper, we explore this attack surface about availability of VLMs and aim to induce high energy-latency cost during inference of VLMs. We find that high energy-latency cost during inference of VLMs can be manipulated by maximizing the length of generated sequences. To this end, we propose verbose images, with the goal of crafting an imperceptible perturbation to induce VLMs to generate long sentences during inference. Concretely, we design three loss objectives. First, a loss is proposed to delay the occurrence of end-of-sequence (EOS) token, where EOS token is a signal for VLMs to stop generating further tokens. Moreover, an uncertainty loss and a token diversity loss are proposed to increase the uncertainty over each generated token and the diversity among all tokens of the whole generated sequence, respectively, which can break output dependency at token-level and sequence-level. Furthermore, a temporal weight adjustment algorithm is proposed, which can effectively balance these losses. Extensive experiments demonstrate that our verbose images can increase the length of generated sequences by 7.87 times and 8.56 times compared to original images on MS-COCO and ImageNet datasets, which presents potential challenges for various applications. Our code is available at https://github.com/KuofengGao/Verbose_Images.

연구 동기 및 목표

  • 대규모 비전-언어 모델(VLM)이 추론 중 에너지 소비와 지연 시간을 증가시키는 적대적 공격에 대한 취약성을 조사하는 것.
  • 생성된 시퀀스의 길이가 VLM에서 에너지 소비와 지연 시간과 강한 상관관계를 가지는지 탐구하는 것.
  • 인식 불가능한 이미지 편향을 통해 VLM의 높은 에너지-지연 비용을 유도하는 방법을 개발하는 것.
  • EOS 토큰 생성을 지연시키고, 출력 불확실성을 높이며, 토큰 다양성을 향상시키는 손실 기반 최적화 프레임워크를 설계하는 것.

제안 방법

  • 종료 시퀀스(EOS) 토큰 생성을 연기함으로써 시퀀스 길이를 연장시키기 위해 지연된 EOS 손실을 제안한다.
  • 토큰 예측의 랜덤성을 높여 토큰 수준의 출력 의존성을 깨뜨리기 위해 불확실성 손실을 도입한다.
  • 생성된 시퀀스의 모든 토큰 간의 다양성을 증진시켜 시퀀스 수준의 예측 가능성 감소를 유도하기 위해 토큰 다양성 손실을 활용한다.
  • 최적화 과정 중 세 손실 목표를 균형 잡기 위해 시간에 따라 가중치를 조정하는 알고리즘을 사용한다.
  • 모멘타임을 사용한 기울기 기반 최적화 과정을 통해 입력 이미지에 인식 불가능한 편향을 생성한다.
  • 공격 효과를 평가하기 위해 실시간 에너지 측정을 위해 NVML을 사용하고, 추론 지연 시간을 기록한다.

실험 결과

연구 질문

  • RQ1VLM에서 생성된 시퀀스 길이와 에너지 소비/지연 시간 사이에 강한 양의 상관관계가 존재하는가?
  • RQ2시각 입력에 대한 적대적 편향을 사용해 VLM에서 훨씬 더 긴 텍스트 생성을 유도할 수 있는가?
  • RQ3의미적 내용을 변경하지 않으면서 생성 과정을 어떻게 조작해 EOS 토큰 발생을 지연시킬 수 있는가?
  • RQ4토큰 생성의 불확실성과 다양성이 얼마나 긴 시퀀스 생성에 기여하는가?
  • RQ5균형 잡힌 다중 손실 최적화 프레임워크는 인식 불가능한 편향을 통해 높은 에너지-지연 비용을 효과적으로 유도할 수 있는가?

주요 결과

  • VLM에서 에너지 소비와 지연 시간은 생성된 시퀀스 길이와 거의 선형적인 양의 상관관계를 보인다.
  • 보수적인 이미지는 네 개의 VLM에 걸쳐 MS-COCO에서는 원본 이미지 대비 7.87배, ImageNet에서는 8.56배의 시퀀스 길이 증가를 유도한다.
  • 이 방법은 시각 토큰 전역에 산산이 흩어진 주의 맵을 가지며, 복잡하고 환각적이며 다양한 출력을 유도한다.
  • 시간에 따른 가중치 조정 알고리즘이 세 손실 목표를 효과적으로 균형 잡아 최적화 안정성과 공격 성공률를 향상시킨다.
  • 실험 결과, 모멘타임 기반 최적화가 공격 성능을 크게 향상시키며, 0.9 모멘타임 설정에서 가장 긴 시퀀스 길이를 기록한다.
  • 공격는 BLIP-2, InstructBLIP, MiniGPT-4와 같은 다양한 VLM에 걸쳐 효과적이며, 고급 LLM 백본을 사용하는 경우에도 성능이 유지된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.