[论文解读] Unveiling the Safety of GPT-4o: An Empirical Study using Jailbreak Attacks
本研究首次对 GPT-4o 的安全性进行了全面的实证评估,采用跨文本、视觉和音频模态的多模态越狱攻击。结果表明,尽管 GPT-4o 在抵御基于文本的越狱攻击方面相比 GPT-4V 有所改进,但引入音频模态后产生了新的攻击向量,且现有黑盒多模态越狱方法对 GPT-4o 的有效性极低,尽管其在多模态层面的脆弱性有所增加。
The recent release of GPT-4o has garnered widespread attention due to its powerful general capabilities. While its impressive performance is widely acknowledged, its safety aspects have not been sufficiently explored. Given the potential societal impact of risky content generated by advanced generative AI such as GPT-4o, it is crucial to rigorously evaluate its safety. In response to this question, this paper for the first time conducts a rigorous evaluation of GPT-4o against jailbreak attacks. Specifically, this paper adopts a series of multi-modal and uni-modal jailbreak attacks on 4 commonly used benchmarks encompassing three modalities (ie, text, speech, and image), which involves the optimization of over 4,000 initial text queries and the analysis and statistical evaluation of nearly 8,000+ response on GPT-4o. Our extensive experiments reveal several novel observations: (1) In contrast to the previous version (such as GPT-4V), GPT-4o has enhanced safety in the context of text modality jailbreak; (2) The newly introduced audio modality opens up new attack vectors for jailbreak attacks on GPT-4o; (3) Existing black-box multimodal jailbreak attack methods are largely ineffective against GPT-4o and GPT-4V. These findings provide critical insights into the safety implications of GPT-4o and underscore the need for robust alignment guardrails in large models. Our code is available at \url{https://github.com/NY1024/Jailbreak_GPT4o}.
研究动机与目标
- 严格评估新一代多模态大语言模型 GPT-4o 对越狱攻击的安全性。
- 研究针对 GPT-4o 在文本、图像和音频模态上,单模态与多模态越狱攻击方法的有效性。
- 评估越狱提示的可迁移性以及 GPT-4o 中对齐护栏相较于 GPT-4V 等先前模型的鲁棒性。
- 识别 GPT-4o 多模态能力引入的新攻击面,特别是音频模态中的新风险。
- 为未来多模态大语言模型的对齐护栏改进提供可操作的见解。
提出的方法
- 本研究通过 OpenAI API 使用超过 4,000 个优化的初始文本查询,对四个基准数据集执行自动化越狱攻击,涵盖 2,000 个单模态文本查询和 2,180 个多模态查询。
- 在 GPT-4o 上评估了 7 种最先进的越狱方法,包括基于模板的方法(GCG、AutoDAN、PAP)和多模态方法(FigStep、Liu et al.、BAP)。
- 针对音频模态,通过 GPT-4o 移动应用手动执行越狱攻击,将已知的文本对抗性提示转化为音频形式。
- 通过四个判断函数(J1–J4)在 13 种攻击场景和 3 种模态下评估安全性,测量在 SafeBench 和 MM-SafetyBench 等基准上的越狱成功率(ASR)。
- 对近 8,000 个模型响应进行统计评估,以确保研究结果的稳健性和可靠性。
- 将 GPT-4o 的表现与 GPT-4V 进行对比,分析各模态下安全性的改进与退化。

实验结果
研究问题
- RQ1GPT-4o 在文本模态下对越狱攻击的安全性相较于 GPT-4V 如何?
- RQ2GPT-4o 的音频模态引入了哪些新的攻击面?基于音频的越狱攻击效果如何?
- RQ3现有黑盒多模态越狱方法在 GPT-4o 和 GPT-4V 上的有效性如何?
- RQ4基于文本的越狱提示的可迁移性对 GPT-4o 等多模态模型有何影响?
- RQ5为何某些攻击方法在攻击条件下表现出的越狱成功率反而低于无攻击基线?
主要发现
- 与 GPT-4V 相比,GPT-4o 在抵御基于文本的越狱攻击方面表现出更强的安全性,多数文本模态场景下的越狱成功率更低。
- 音频模态引入了新颖且有效的攻击面,通过音频转换的对抗性提示可成功越狱 GPT-4o。
- 现有黑盒多模态越狱方法对 GPT-4o 和 GPT-4V 均基本无效,表现为攻击条件下的越狱成功率低于无攻击基线。
- 在多模态层面,GPT-4o 的安全性低于 GPT-4V,MM-SafetyBench 上多数场景的越狱成功率更高,包括政治游说场景 72.8% 和法律意见场景 98.1%。
- 基于模板的越狱方法效果下降,表明 OpenAI 可能已主动缓解已知的越狱模式。
- 攻击条件下越狱成功率低于无攻击基线的异常现象,暗示 OpenAI 可能已部署针对基于图像语义攻击的防御机制。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。