Skip to main content
QUICK REVIEW

[論文レビュー] MM-SafetyBench: A Benchmark for Safety Evaluation of Multimodal Large Language Models

Xin Liu, Yichen Zhu|arXiv (Cornell University)|Nov 29, 2023
Digital Media Forensic Detection被引用数 7
ひとこと要約

本稿では、画像ベースのプロンプト攻撃に対してマルチモーダル大規模言語モデル(MLLM)の安全性を評価するためのベンチマーク、MM-SafetyBenchを紹介する。Stable Diffusionおよびタイポグラフィーを用いてクエリに関連する画像を生成することで、安全対策の微調整が施されたモデルですら、安全対策の回避に極めて脆弱であることが示された。単純なプロンプト戦略が攻撃成功率を顕著に低下させることから、オープンソースのMLLMにおける深刻なセキュリティ的欠陥が浮き彫りになった。

ABSTRACT

The security concerns surrounding Large Language Models (LLMs) have been extensively explored, yet the safety of Multimodal Large Language Models (MLLMs) remains understudied. In this paper, we observe that Multimodal Large Language Models (MLLMs) can be easily compromised by query-relevant images, as if the text query itself were malicious. To address this, we introduce MM-SafetyBench, a comprehensive framework designed for conducting safety-critical evaluations of MLLMs against such image-based manipulations. We have compiled a dataset comprising 13 scenarios, resulting in a total of 5,040 text-image pairs. Our analysis across 12 state-of-the-art models reveals that MLLMs are susceptible to breaches instigated by our approach, even when the equipped LLMs have been safety-aligned. In response, we propose a straightforward yet effective prompting strategy to enhance the resilience of MLLMs against these types of attacks. Our work underscores the need for a concerted effort to strengthen and enhance the safety measures of open-source MLLMs against potential malicious exploits. The resource is available at https://github.com/isXinLiu/MM-SafetyBench

研究の動機と目的

  • マルチモーダルLLMが安全対策を回避する画像ベースのプロンプト攻撃に対してどれほど脆弱であるかを調査すること。
  • クエリに関連する画像が、安全対策の微調整が施された状態でも、MLLMに有害なコンテンツの生成を誘発する仕組みを特定すること。
  • 多様な有害コンテンツのシナリオにわたるMLLMの安全性を体系的かつ包括的に評価するためのベンチマークを構築すること。
  • 画像ベースの攻撃に対してMLLMの耐性を高めるためのプロンプトに基づく防御戦略を提案・検証すること。
  • オープンソースのMLLMにおける悪意ある利用を防ぐために、より強固な安全対策メカニズムの導入が急務であることを強調すること。

提案手法

  • 違法行為、差別的発言、身体的危害など13の安全対策が重要なシナリオにわたり、合計5,040組のテキスト-画像ペアを含むベンチマークを構築した。
  • 悪意あるクエリから抽出したキーワードに基づき、Stable Diffusionおよびタイポグラフィックレンダリングを用いて攻撃用画像を生成した。
  • GPT-4を用いてユーザークエリからキーワードを抽出・検証し、有害な内容と意味的に関連するかを確認した。
  • 二段階の画像生成パイプラインを設計した:一つはテキストから画像を生成する拡散モデルを用いるもの、もう一つは視覚的タイポグラフィーを用いて感受性の高い用語をエンコードするもの。
  • 悪意あるクエリに対して応答を拒否するよう指示する安全プロンプト戦略を実装し、モデルの耐性を向上させた。
  • LLMベースの分類器を用いて自動的に安全対策の評価を実施し、拒否行動の有無と攻撃成功率を評価した。

実験結果

リサーチクエスチョン

  • RQ1クエリに関連する画像は、最先端のMLLMの安全対策をどの程度効果的に回避できるか?
  • RQ2画像ベースのプロンプト攻撃は、多様な安全対策が重要なシナリオにおいて、有害な応答を引き出すのにどの程度有効か?
  • RQ3単純なプロンプト戦略は、このような画像ベースの攻撃の成功率を顕著に低下させることができるか?
  • RQ4安全対策が施されたMLLMであっても、攻撃成功率はモデルによってどのように変動するか?
  • RQ5MLLMの安全対策の弱みを悪用するための、最も効果的な画像生成技術は何か?

主な発見

  • MLLMは画像ベースのプロンプト攻撃に対して極めて脆弱であり、クエリに関連する画像が使用される際、クエリに無関係な画像を使用した場合と比較して攻撃成功率が顕著に上昇した。
  • 安全対策が施されたMLLM、例えばLLaVA-1.5ですら、これらの攻撃に対して感受性を示しており、現行の対策手法が視覚的プロンプトインジェクションに対して不十分であることが示された。
  • Stable Diffusionで生成された画像とタイポグラフィック表現の組み合わせが、ベンチマークの全13のシナリオで高い攻撃成功率を達成した。
  • 提案された安全プロンプト戦略により、攻撃成功率が顕著に低下した。これは、単純なプロンプト設計がモデルの耐性を高められることを示している。
  • 多くのMLLMが、意図的に作成された画像を提示された際には有害なクエリに対して拒否できず、テキストのみのバージョンでは正しく拒否することができたにもかかわらず、そのような失敗を示した。
  • ベンチマークにより、モデルが有害な意図を内包する画像の微細な視覚的手がかりを検出できないことが明らかになった。これは、マルチモーダルな安全対策における深刻な盲点を露呈している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。