Skip to main content
QUICK REVIEW

[논문 리뷰] Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization

Zhexin Zhang, Junxiao Yang|arXiv (Cornell University)|2023. 11. 15.
Text Readability and Simplification인용 수 6
한 줄 요약

이 논문은 추론 및 훈련 단계에서 안전성 우선 원칙을 명시적으로 적용함으로써 대규모 언어 모델(Large Language Models, LLMs)을 제재 회피 공격으로부터 방어하는 방법을 제안한다. 이는 추론 단계에서 ChatGPT의 공격 성공률(ASR)을 66.4%에서 2.0%로, Vicuna-33B의 경우 68.2%에서 19.4%로 감소시키며, 훈련 단계에서 목표 우선순위를 적용한 Llama2-13B는 제재 데이터 없이도 ASR가 6.6%에 불과하다.

ABSTRACT

While significant attention has been dedicated to exploiting weaknesses in LLMs through jailbreaking attacks, there remains a paucity of effort in defending against these attacks. We point out a pivotal factor contributing to the success of jailbreaks: the intrinsic conflict between the goals of being helpful and ensuring safety. Accordingly, we propose to integrate goal prioritization at both training and inference stages to counteract. Implementing goal prioritization during inference substantially diminishes the Attack Success Rate (ASR) of jailbreaking from 66.4% to 3.6% for ChatGPT. And integrating goal prioritization into model training reduces the ASR from 71.0% to 6.6% for Llama2-13B. Remarkably, even in scenarios where no jailbreaking samples are included during training, our approach slashes the ASR by half. Additionally, our findings reveal that while stronger LLMs face greater safety risks, they also possess a greater capacity to be steered towards defending against such attacks, both because of their stronger ability in instruction following. Our work thus contributes to the comprehension of jailbreaking attacks and defenses, and sheds light on the relationship between LLMs' capability and safety. Our code is available at \url{https://github.com/thu-coai/JailbreakDefense_GoalPriority}.

연구 동기 및 목표

  • 제재 회피 공격 성공의 근본 원인을 규명하는 것. 이는 LLMs에서 유용성과 안전성 목표 간의 해결되지 않은 갈등에서 기인한다.
  • SFT 및 RLHF와 같은 정렬 기법의 발전에도 불구하고 제재 회피 공격에 대한 효과적인 방어 수단이 부족한 문제를 해결하는 것.
  • 추론 및 훈련 단계 모두에서 안전성 우선 원칙을 명시적으로 적용하는 방어 메커니즘을 개발하는 것.
  • 훈련 중에 제재 프롬프트를 사용하지 않은 경우에도, 특히 분포 외(OOD) 제재 회피 공격에 대한 방어 방법의 일반화 능력을 평가하는 것.
  • LLM의 성능과 안전성 간의 관계를 탐구하는 것. 특히 더 강력한 모델일수록 더 취약하거나 더 잘 방어 가능한지 여부를 분석하는 것.

제안 방법

  • 사용자 프롬프트와 안전성 우선 원칙을 강조하는 목표 지시문을 별도로 쌍으로 조합하여 추론 시점에서 목표 우선순위를 삽입하는 플러그 앤 플레이 프롬프팅 전략을 설계한다.
  • 모델이 응답을 생성하기 전에 먼저 목표 우선순위(안전성 > 유용성)를 식별하도록 하는 이중 단계 프롬프팅 프레임워크를 사용한다.
  • 훈련 단계에서는 안전성 우선 원칙을 구현하기 위해 유해 및 양호한 지시문의 혼합 데이터로 모델를 피팅(fine-tune)함으로써 목표 우선순위를 통합한다.
  • 방어 성능에 대한 데이터 효율성과 다양성의 영향을 평가하기 위해, 유해 프롬프트 비율을 제어하여 1%, 3%, 5%로 설정한 훈련 데이터를 포함한다.
  • 방어 메커니즘은 내부 분포 및 외부 분포 제재 회피 프롬프트 모두에서 공격 성공률(ASR)과 방어 성공률(DSR)을 사용하여 평가된다.
  • API 기반 및 오픈소스 모델을 포함한 여러 LLMs인 ChatGPT, Vicuna, Llama2, Alpaca에 대해 이 방법을 적용한다.

실험 결과

연구 질문

  • RQ1SFT 및 RLHF와 같은 표준 정렬 방법은 안전성을 향상시키지만, 제재 회피 공격에 대해 왜 방어에 실패하는가?
  • RQ2안전성을 주요 목표로 명시적으로 설정하는 목표 우선순위 전략이 제재 회피 공격의 성공률을 크게 감소시킬 수 있는가?
  • RQ3모델 재학습 없이 추론 단계에서만 목표 우선순위를 적용할 경우, 그 효과는 어떠한가?
  • RQ4목표 우선순위 전략이 분포 외(OOD) 제재 회피 공격에 대해 얼마나 잘 일반화되는가?
  • RQ5모델의 성능과 제재 회피에 대한 취약성 간의 상관관계는 존재하는가? 더 강력한 모델은 안전성으로 더 잘 이끌릴 수 있는가?

주요 결과

  • 목표 우선순위를 추론 시점에 적용했을 때 ChatGPT의 공격 성공률(ASR)은 66.4%에서 2.0%로 감소하여 제재 성공률이 97% 감소함을 입증한다.
  • Vicuna-33B의 경우 동일한 추론 기반 방어 조건에서 ASR가 68.2%에서 19.4%로 감소하여 다양한 모델에 대해 강력한 내성적 저항력을 보임을 확인한다.
  • 목표 우선순위를 훈련 단계에서 적용한 Llama2-13B는 표준 SFT를 사용한 경우 71.0% 대비 ASR가 단 6.6%에 그쳐, 취약성 감소율이 90.7%에 이르며 매우 높은 방어 성능을 보인다.
  • 훈련 데이터에 제재 프롬프트가 전혀 포함되지 않은 경우에도, 이 방법은 ASR를 71.0%에서 34.0%로 감소시켜, 간단한 유해 지시문만으로도 목표 우선순위를 학습할 수 있음을 보여준다.
  • 분포 외(OOD) 제재 회피 공격에 대해서도 방어 성능이 잘 일반화됨: 훈련에 제재 프롬프트를 사용하지 않은 경우, 정렬된 SFT 대비 22.8% 향상된 방어 성공률(DSR)과 순수 SFT 대비 30% 향상된 DSR를 기록한다.
  • 데이터 효율성 또한 뛰어남: 목표 우선순위를 적용한 1% 유해 프롬프트만으로도 정렬된 SFT에서 5%를 사용한 경우보다 더 낮은 ASR를 달성하여, 더 효율적인 데이터 활용 능력을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.