[논문 리뷰] Safety Fine-Tuning at (Almost) No Cost: A Baseline for Vision Large Language Models
이 논문은 시각-언어 안전 지시 수행 데이터셋인 VLGuard를 소개한다. 이는 시각-대화형 대규모 언어 모델(VLLM)의 미세조정을 위한 최초의 데이터셋이다. VLGuard를 사용해 사후 또는 혼합 미세조정을 적용함으로써 VLLM은 안전성 면에서 크게 향상되며, 거의 0에 수렴하는 절도 성공률을 기록한다. 이와 동시에 유용성은 유지되거나 향상되며, VLLM 안전성 정렬을 위한 저비용이고 효과적인 기반을 제공한다.
Current vision large language models (VLLMs) exhibit remarkable capabilities yet are prone to generate harmful content and are vulnerable to even the simplest jailbreaking attacks. Our initial analysis finds that this is due to the presence of harmful data during vision-language instruction fine-tuning, and that VLLM fine-tuning can cause forgetting of safety alignment previously learned by the underpinning LLM. To address this issue, we first curate a vision-language safe instruction-following dataset VLGuard covering various harmful categories. Our experiments demonstrate that integrating this dataset into standard vision-language fine-tuning or utilizing it for post-hoc fine-tuning effectively safety aligns VLLMs. This alignment is achieved with minimal impact on, or even enhancement of, the models' helpfulness. The versatility of our safety fine-tuning dataset makes it a valuable resource for safety-testing existing VLLMs, training new models or safeguarding pre-trained VLLMs. Empirical results demonstrate that fine-tuned VLLMs effectively reject unsafe instructions and substantially reduce the success rates of several black-box adversarial attacks, which approach zero in many cases. The code and dataset are available at https://github.com/ys-zong/VLGuard.
연구 동기 및 목표
- 시각-언어 지시 미세조정 과정에서 유해한 데이터로 인해 발생하는 VLLM의 심각한 취약성인 절도 공격과 유해 콘텐츠 생성 문제를 해결한다.
- 시각-언어 데이터로 LLM을 미세조정할 경우 기존의 안전성 정렬이 깨지고, 해로운 출력에 더 취약해지는 것을 규명한다.
- 유용성에 영향을 주지 않고도 효과적인 VLLM 안전성 정렬을 가능하게 하는 전용이며 다용도의 안전 데이터셋(VLGuard)을 개발한다.
- 기존 VLLM 훈련 파이프라인에 최소한의 계산 비용으로 안전성 정렬을 통합할 수 있는 실용적인 두 가지 미세조정 전략(사후 및 혼합 훈련)을 제안한다.
- VLLM 안전성 평가를 위한 벤치마크를 수립하고, 향후 다중모달 LLM의 강력한 안전 메커니즘 기반을 마련한다.
제안 방법
- 다양한 유해 유형을 포함한 시각-언어 안전 지시 수행 데이터셋인 VLGuard를 구축하며, 텍스트 전용 및 시각-언어 기반의 악성 예제를 포함한다.
- 초기 사전학습 및 시각-언어 정렬 이후에 VLGuard 데이터로 VLLM을 훈련시켜 사후 미세조정을 수행함으로써 원래의 능력을 유지한다.
- 표준 시각-언어 데이터와 VLGuard 데이터를 동시에 훈련시켜 종단 간 안전성 통합을 실현하는 혼합 미세조정을 구현한다.
- 모든 파rameter 미세조정과 LoRA(Low-Rank Adaptation)를 모두 활용하여 다양한 훈련 방식과 모델 아키텍처와의 호환성을 확보한다.
- 블랙박스 절도 공격에 대한 강건성을 테스트하기 위한 종합적인 평가 세트를 설계한다. 이는 프롬프트 기반 공격 및 이미지 기반 트리거를 포함한다.
- 기존에 안전성 정렬이 된 LLM을 기반으로 사용하여, 시각-언어 미세조정 과정에서 안전성 정렬이 무시되거나 덮어쓰이지 않도록 한다.
실험 결과
연구 질문
- RQ1시각-언어 지시 미세조정을 통해 사전학습된 LLM의 안전성 정렬이 얼마나 악화되는가? 이는 VLLM을 구축할 때 발생하는 문제이다.
- RQ2전용으로 설계된 소규모 시각-언어 안전 데이터셋이 VLLM의 안전성을 향상시키며, 동시에 유용성이나 성능에 악영향을 주지 않고 효과를 발휘할 수 있는가?
- RQ3사후 및 혼합 미세조정 전략이 블랙박스 절도 공격에 대한 VLLM의 강건성을 얼마나 효과적으로 향상시키는가?
- RQ4제안된 안전성 미세조정 전략은 다양한 VLLM 아키텍처와 파rameter 스케일에 일반화 가능한가?
- RQ5훈련 중에 안전성 정렬을 통합하는 것과 사후 단계에서 적용하는 것의 안전성 및 성능 트레이드오프에 미치는 영향은 무엇인가?
주요 결과
- VLGuard로 VLLM을 미세조정하면 블랙박스 절도 공격의 성공률이 거의 0으로 떨어지며, 일부 모델은 불법 지시의 100%를 거부하는 결과를 보였다.
- LLaVA-v1.5-13B에 대해 사후 미세조정을 수행한 결과, 안전-비안전 카테고리에서 유해 출력 비율이 96.67%에서 100%로 감소하여 강력한 정렬 향상 효과를 입증했다.
- MiniGPT-v2에서 혼합 미세조정 전략을 적용한 결과, 비안전 카테고리에서 유해 출력 비율이 90.00%에서 42.00%로 감소하여 다양한 모델 아키텍처에서의 효과를 입증했다.
- VLGuard를 통한 안전성 정렬은 유지되거나 약간 향상된 유용성을 유지하며, 표준 시각-언어 벤치마크에서 성능 저하가 없었다.
- 이 방법은 계산 비용이 매우 효율적이며, 단지 2,000장의 정제된 이미지만 필요로 하며, LoRA 및 전체 파라미터 미세조정 모두와 호환된다.
- 이 데이터셋과 미세조정 전략은 LLaVA 및 MiniGPT와 같은 여러 모델에서 효과를 보여, 광범위한 적용 가능성과 확장성을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.