Skip to main content
QUICK REVIEW

[論文レビュー] Inducing High Energy-Latency of Large Vision-Language Models with Verbose Images

Kuofeng Gao, Yang Bai|arXiv (Cornell University)|Jan 20, 2024
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

本稿では、推論中に視覚言語モデル(VLM)が過剰に長く、複雑で多様なテキスト系列を生成するように誘導する、目に見えない敵対的摂動であるボリューム画像(verbose images)を提案する。3つの損失目的を通じて、終了トークン(EOS)の生成を遅らせる、トークンレベルの不確実性を高め、系列レベルの多様性を向上させることで、複数のVLMにおいてImageNetでは最大8.56倍、MS-COCOでは最大7.87倍のエネルギーとレイテンシコストを増加させ、新たな可用性ベースの回避攻撃を実証した。

ABSTRACT

Large vision-language models (VLMs) such as GPT-4 have achieved exceptional performance across various multi-modal tasks. However, the deployment of VLMs necessitates substantial energy consumption and computational resources. Once attackers maliciously induce high energy consumption and latency time (energy-latency cost) during inference of VLMs, it will exhaust computational resources. In this paper, we explore this attack surface about availability of VLMs and aim to induce high energy-latency cost during inference of VLMs. We find that high energy-latency cost during inference of VLMs can be manipulated by maximizing the length of generated sequences. To this end, we propose verbose images, with the goal of crafting an imperceptible perturbation to induce VLMs to generate long sentences during inference. Concretely, we design three loss objectives. First, a loss is proposed to delay the occurrence of end-of-sequence (EOS) token, where EOS token is a signal for VLMs to stop generating further tokens. Moreover, an uncertainty loss and a token diversity loss are proposed to increase the uncertainty over each generated token and the diversity among all tokens of the whole generated sequence, respectively, which can break output dependency at token-level and sequence-level. Furthermore, a temporal weight adjustment algorithm is proposed, which can effectively balance these losses. Extensive experiments demonstrate that our verbose images can increase the length of generated sequences by 7.87 times and 8.56 times compared to original images on MS-COCO and ImageNet datasets, which presents potential challenges for various applications. Our code is available at https://github.com/KuofengGao/Verbose_Images.

研究の動機と目的

  • 大規模な視覚言語モデル(VLM)が推論中にエネルギーとレイテンシが増加するような敵対的攻撃に対する脆弱性を調査すること。
  • 生成系列の長さがVLMにおけるエネルギー消費量とレイテンシに強く相関しているかどうかを調査すること。
  • 目に見えない画像摂動を用いてVLMに高エネルギー・高レイテンシのコストを誘発する手法を開発すること。
  • EOSトークン生成の遅延、出力の不確実性の増加、トークン多様性の向上を目的とした損失ベースの最適化フレームワークを設計すること。

提案手法

  • 終了トークン(EOS)の生成を遅らせるための遅延EOS損失を提案し、系列長を延長する。
  • トークン予測のランダム性を高め、トークンレベルの出力依存性を解消するための不確実性損失を導入。
  • 生成系列内のすべてのトークンにおける変動を促進し、系列レベルの予測可能性を低下させるためのトークン多様性損失を採用。
  • 最適化過程で3つの損失目的をバランスさせるために、時間的重み調整アルゴリズムを適用。
  • 勾配ベースの最適化プロセスにモーメンタムを組み込み、入力画像に目に見えない摂動を生成。
  • 攻撃効果を評価するために、リアルタイムでのエネルギー測定にNVMLを活用し、推論レイテンシを記録。

実験結果

リサーチクエスチョン

  • RQ1VLMにおける生成系列長とエネルギー消費量/レイテンシの間に強い正の相関関係があるか?
  • RQ2視覚入力に対する敵対的摂動を用いて、VLMが著しく長いテキスト生成を誘発できるか?
  • RQ3意味的コンテンツを変更せずに、生成プロセスをどのように操作すればEOSトークンの出現を遅らせられるか?
  • RQ4トークン生成における不確実性と多様性は、どれほど長大な系列の生成に寄与するか?
  • RQ5バランスの取れたマルチ損失最適化フレームワークは、目に見えない摂動を用いて高エネルギー・高レイテンシを効果的に誘発できるか?

主な発見

  • VLMにおけるエネルギー消費量とレイテンシは、生成系列長に対してほぼ線形の正の相関関係を示す。
  • ボリューム画像は、4つのVLM across で、MS-COCOでは7.87倍、ImageNetでは8.56倍の系列長増加を実現。
  • 本手法は、分散した注意マップを伴い、複雑で幻覚的かつ多様な出力を誘発する。
  • 時間的重み調整アルゴリズムは、3つの損失目的を効果的にバランスさせ、最適化の安定性と攻撃成功率を向上させる。
  • 実験では、モーメンタムベースの最適化が攻撃性能を顕著に向上させ、0.9のモーメンタムが最も長い系列長を達成した。
  • BLIP-2、InstructBLIP、MiniGPT-4を含む多様なVLMにおいても、高度なLLMバックボーンを搭載したモデルに対しても攻撃は有効である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。