Skip to main content
QUICK REVIEW

[论文解读] Safety Fine-Tuning at (Almost) No Cost: A Baseline for Vision Large Language Models

Yongshuo Zong, Ondrej Bohdal|arXiv (Cornell University)|Feb 3, 2024
Natural Language Processing Techniques被引用 4
一句话总结

本文提出了 VLGuard,这是首个用于微调视觉语言大模型(VLLM)的安全对齐指令遵循数据集。通过在 VLGuard 上进行后训练或混合微调,VLLM 的安全性显著提升——越狱攻击成功率降至接近零,同时保持或甚至增强了有用性,为 VLLM 安全对齐提供了一种低成本、高效的基线方案。

ABSTRACT

Current vision large language models (VLLMs) exhibit remarkable capabilities yet are prone to generate harmful content and are vulnerable to even the simplest jailbreaking attacks. Our initial analysis finds that this is due to the presence of harmful data during vision-language instruction fine-tuning, and that VLLM fine-tuning can cause forgetting of safety alignment previously learned by the underpinning LLM. To address this issue, we first curate a vision-language safe instruction-following dataset VLGuard covering various harmful categories. Our experiments demonstrate that integrating this dataset into standard vision-language fine-tuning or utilizing it for post-hoc fine-tuning effectively safety aligns VLLMs. This alignment is achieved with minimal impact on, or even enhancement of, the models' helpfulness. The versatility of our safety fine-tuning dataset makes it a valuable resource for safety-testing existing VLLMs, training new models or safeguarding pre-trained VLLMs. Empirical results demonstrate that fine-tuned VLLMs effectively reject unsafe instructions and substantially reduce the success rates of several black-box adversarial attacks, which approach zero in many cases. The code and dataset are available at https://github.com/ys-zong/VLGuard.

研究动机与目标

  • 解决 VLLM 在视觉语言指令微调过程中因使用不安全数据而面临的越狱攻击和有害内容生成等关键脆弱性。
  • 识别出使用视觉语言数据微调 LLM 会破坏其原有的安全对齐,从而增加有害输出的脆弱性。
  • 开发一个专用且多功能的安全数据集(VLGuard),以在不损害有用性的情况下,实现 VLLM 的有效安全对齐。
  • 提出两种实用的微调策略——后训练和混合训练——将安全对齐无缝集成到现有的 VLLM 训练流程中,计算成本极低。
  • 建立一个用于评估 VLLM 安全性的基准,并为多模态 LLM 的未来鲁棒安全机制奠定基础。

提出的方法

  • 构建 VLGuard,一个涵盖多样化有害类别(包括纯文本和视觉语言对抗样本)的视觉语言安全指令遵循数据集。
  • 通过后训练微调:在初始预训练和视觉语言对齐之后,对 VLLM 进行 VLGuard 数据的微调,以保留原始能力。
  • 实施混合微调:将标准视觉语言数据与 VLGuard 数据联合训练,实现端到端的安全集成。
  • 同时采用全参数微调和 LoRA(低秩适应)方法,以确保与各种训练范式和模型架构的兼容性。
  • 设计全面的评估套件,用于测试对黑盒越狱攻击的鲁棒性,包括提示工程和基于图像的触发机制。
  • 利用现有的安全对齐 LLM 作为基础模型,确保在视觉语言微调过程中安全对齐得到强化而非覆盖。

实验结果

研究问题

  • RQ1在构建 VLLM 时,使用视觉语言指令微调是否会导致预训练 LLM 的安全对齐显著退化?
  • RQ2一个专用的小规模视觉语言安全数据集能否在不降低有用性或性能的前提下,有效提升 VLLM 的安全性?
  • RQ3后训练和混合微调策略在提升 VLLM 对黑盒越狱攻击的鲁棒性方面效果如何?
  • RQ4所提出的安全部署策略是否能泛化到不同架构和参数规模的 VLLM 上?
  • RQ5在训练期间集成安全对齐与作为后处理步骤应用安全对齐,在安全性和性能之间的权衡如何?

主要发现

  • 使用 VLGuard 微调 VLLM 可将黑盒越狱攻击的成功率降至接近零,部分模型在不安全指令上的拒绝率达到 100%。
  • 在 LLaVA-v1.5-13B 上进行后训练微调,使不安全类别中的有害输出从 96.67% 降低至 100%,表明安全对齐显著改善。
  • 在 MiniGPT-v2 上采用混合微调策略,使不安全类别中的有害输出从 90.00% 降低至 42.00%,证明其在不同模型架构中的有效性。
  • 通过 VLGuard 实现的安全对齐在保持或轻微提升有用性的同时,未在标准视觉语言基准测试中造成性能显著下降。
  • 该方法计算效率高,仅需 2,000 张精心筛选的图像,并且与 LoRA 和全参数微调均兼容。
  • 该数据集和微调策略在多个模型(包括 LLaVA 和 MiniGPT)上均表现有效,表明其具有广泛的适用性和可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。