Skip to main content
QUICK REVIEW

[論文レビュー] Unveiling the Safety of GPT-4o: An Empirical Study using Jailbreak Attacks

Zonghao Ying, Aishan Liu|arXiv (Cornell University)|Jun 10, 2024
Artificial Intelligence in Healthcare and EducationMedicine被引用数 3
ひとこと要約

本研究では、テキスト、視覚、音声の複数モダリティにわたるマルチモーダルな jailbreak 攻撃を用いて、GPT-4o の安全性に関する最初の包括的で実証的な評価を実施した。その結果、GPT-4o は GPT-4V よりもテキストベースの jailbreak 攻撃に対して耐性が向上しているが、音声モダリティの導入により新たな攻撃ベクトルが生じており、既存のブラックボックスマルチモーダル jailbreak メソッドは GPT-4o に対してはほとんど効果を示さないことが判明した。ただし、マルチモーダルレベルでの脆弱性は増加している。

ABSTRACT

The recent release of GPT-4o has garnered widespread attention due to its powerful general capabilities. While its impressive performance is widely acknowledged, its safety aspects have not been sufficiently explored. Given the potential societal impact of risky content generated by advanced generative AI such as GPT-4o, it is crucial to rigorously evaluate its safety. In response to this question, this paper for the first time conducts a rigorous evaluation of GPT-4o against jailbreak attacks. Specifically, this paper adopts a series of multi-modal and uni-modal jailbreak attacks on 4 commonly used benchmarks encompassing three modalities (ie, text, speech, and image), which involves the optimization of over 4,000 initial text queries and the analysis and statistical evaluation of nearly 8,000+ response on GPT-4o. Our extensive experiments reveal several novel observations: (1) In contrast to the previous version (such as GPT-4V), GPT-4o has enhanced safety in the context of text modality jailbreak; (2) The newly introduced audio modality opens up new attack vectors for jailbreak attacks on GPT-4o; (3) Existing black-box multimodal jailbreak attack methods are largely ineffective against GPT-4o and GPT-4V. These findings provide critical insights into the safety implications of GPT-4o and underscore the need for robust alignment guardrails in large models. Our code is available at \url{https://github.com/NY1024/Jailbreak_GPT4o}.

研究の動機と目的

  • GPT-4o、次世代のマルチモーダル大規模言語モデルの安全性を、jailbreak 攻撃に対して厳密に評価すること。
  • テキスト、画像、音声の各モダリティにわたって、単一モダリティおよびマルチモーダル jailbreak 攻撃手法の GPT-4o に対する有効性を調査すること。
  • GPT-4V らしい以前のモデルと比較して、jailbreak プロンプトの転送性およびアライメントガードレールの堅牢性を評価すること。
  • GPT-4o のマルチモーダル機能によって新たに生じる攻撃表面、特に音声モダリティにおけるものを同定すること。
  • 将来のマルチモーダル LLM のアライメントガードレールを改善するための実務的知見を提供すること。

提案手法

  • 本研究では、4,000 以上の最適化された初期テキストクエリを用いて、2,000 件の単一モダリティテキストクエリおよび 2,180 件のマルチモーダルクエリを、4 つのベンチマークデータセット上で自動化された jailbreak 攻撃を実施した。
  • OpenAI API を介して、GPT-4o に対して 7 種類の最先端 jailbreak メソッド(テンプレートベース:GCG、AutoDAN、PAP、およびマルチモーダル手法:FigStep、Liu et al.、BAP)を評価した。
  • 音声モダリティに関しては、GPT-4o モバイルアプリを用いて手動での jailbreak 攻撃を実施し、既知のテキストベースの敵対的プロンプトを音声形式に変換した。
  • 安全性は、13 件の攻撃シナリオおよび 3 モダリティにわたって J1–J4 の 4 つの判断関数を用い、SafeBench や MM-SafetyBench などのベンチマークにおける jailbreak 成功率(ASR)を測定した。
  • ほぼ 8,000 回のモデル出力を統計的に評価することで、研究結果の堅牢性と信頼性を確保した。
  • GPT-4V との比較を通じて、GPT-4o の安全性が各モダリティでどのように向上または後退したかを分析した。
(a) Results of $\mathcal{J}_{1}$ .
(a) Results of $\mathcal{J}_{1}$ .

実験結果

リサーチクエスチョン

  • RQ1GPT-4o は、特にテキストモダリティにおいて、GPT-4V よりも jailbreak 攻撃に対して安全性が高いと言えるか?
  • RQ2GPT-4o の音声モダリティによって新たに生じる攻撃表面は何か? また、音声ベースの jailbreak はどの程度効果的か?
  • RQ3既存のブラックボックスマルチモーダル jailbreak メソッドは、GPT-4o および GPT-4V に対してどの程度有効か?
  • RQ4テキストベースの jailbreak プロンプトの転送性は、GPT-4o のようなマルチモーダルモデルにどのように影響を与えるか?
  • RQ5なぜ一部の攻撃手法では、攻撃条件下での成功率がノーマル状態(攻撃なし)の基準値を下回るという異常な結果が観察されるのか?

主な発見

  • GPT-4o は、GPT-4V よりもテキストベースの jailbreak 攻撃に対して安全性が向上しており、ほとんどのテキストモダリティのシナリオで jailbreak 成功率が低かった。
  • 音声モダリティは、新たなかつ効果的な攻撃表面を提供しており、音声に変換された敵対的プロンプトが GPT-4o を正常に jailbreak した。
  • 既存のブラックボックスマルチモーダル jailbreak メソッドは、GPT-4o や GPT-4V に対してほとんど効果を示さず、攻撃下での成功率がノーマル状態より低かった。
  • GPT-4o はマルチモーダルレベルで GPT-4V よりも安全性が低く、MM-SafetyBench においてほとんどのシナリオで高い jailbreak 成功率を示しており、特に「政治的ロビー活動」で 72.8%、「法的意見」で 98.1% の成率を記録した。
  • テンプレートベースの jailbreak メソッドは有効性が低下しており、OpenAI が既知の jailbreak パatters を事前に緩和した可能性を示している。
  • 攻撃条件での成功率がノーマル状態より低いという異常パターンは、OpenAI が画像ベースの意味的攻撃に対抗する防御を実装している可能性を示唆している。
(b) Results of $\mathcal{J}_{2}$ .
(b) Results of $\mathcal{J}_{2}$ .

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。