[논문 리뷰] A Wolf in Sheep's Clothing: Generalized Nested Jailbreak Prompts can Fool Large Language Models Easily
이 논문은 LLM의 안전성 정렬을 우회하기 위해 프롬프트 재작성과 시나리오 중첩을 통해 잠금 풀기 프롬프트 공격을 일반화하는 자동화된 프레임워크인 ReNeLLM을 제안한다. 일반적인 작업에 임bed된 의미가 유지되지만 더 정교한 프롬프트를 생성하기 위해 LLM을 활용함으로써 ReNeLLM은 기준보다 40퍼센트 이상 높은 공격 성공률를 달성하면서도 시간 비용을 줄여, 현재 방어 메커니즘의 심각한 취약성을 드러낸다.
Large Language Models (LLMs), such as ChatGPT and GPT-4, are designed to provide useful and safe responses. However, adversarial prompts known as 'jailbreaks' can circumvent safeguards, leading LLMs to generate potentially harmful content. Exploring jailbreak prompts can help to better reveal the weaknesses of LLMs and further steer us to secure them. Unfortunately, existing jailbreak methods either suffer from intricate manual design or require optimization on other white-box models, which compromises either generalization or efficiency. In this paper, we generalize jailbreak prompt attacks into two aspects: (1) Prompt Rewriting and (2) Scenario Nesting. Based on this, we propose ReNeLLM, an automatic framework that leverages LLMs themselves to generate effective jailbreak prompts. Extensive experiments demonstrate that ReNeLLM significantly improves the attack success rate while greatly reducing the time cost compared to existing baselines. Our study also reveals the inadequacy of current defense methods in safeguarding LLMs. Finally, we analyze the failure of LLMs defense from the perspective of prompt execution priority, and propose corresponding defense strategies. We hope that our research can catalyze both the academic community and LLMs developers towards the provision of safer and more regulated LLMs. The code is available at https://github.com/NJUNLP/ReNeLLM.
연구 동기 및 목표
- 수동적 또는 최적화 기반의 잠금 풀기 방법의 한계를 해결하기 위해, 이는 시간이 오래 걸리거나 취약하거나 의미적으로 자연스럽지 않기 때문이다.
- 프롬프트 재작성과 시나리오 중첩이라는 두 가지 핵심 패턴을 식별하여 잠금 풀기 공격을 일반화하기 위해.
- 피팅 트레이닝이나 최적화 없이 LLM 자체를 활용해 고성공률의 잠금 풀기 프롬프트를 자동으로 생성하는 효율적이고 효과적인 프레임워크를 개발하기 위해.
- 이러한 일반화된 공격에 대해 현재 방어 메커니즘의 강건성을 평가하기 위해.
- 프롬프트 실행 중 주의 메커니즘을 분석함으로써 LLM이 악성 콘텐츠를 탐지하지 못하는 이유를 밝혀내기 위해.
제안 방법
- ReNeLLM은 잠금 풀기 공격을 두 구성 요소로 일반화한다: 프롬프트 재작성과 시나리오 중첩.
- 프롬프트 재작성은 의미를 유지하면서도 탐지 회피를 위해 언어적 변환(예: 동의어 교체, 문법 재구성, 철자 오류)을 적용한다.
- 시나리오 중첩은 테이블 채우기, 텍스트 완성, 또는 코드 생성과 같은 일반적인 작업 맥락에 재작성된 프롬프트를 통합하여 악성 의도를 가림한다.
- 프레임워크는 LLM을 활용해 재작성 및 중첩 전략의 최적 조합을 자동으로 탐색하고 선택한다.
- 추가 학습이나 기울기 기반 최적화 없이, 오직 LLM의 추론 및 생성 능력에 의존한다.
- 주의 시각화를 통해 실행 중 LLM이 외부 지시어 대비 내부 악성 프롬프트를 어떻게 우선순위를 정하는지 분석함으로써, 탐지 회피를 가능하게 하는 주의의 변화를 드러낸다.

실험 결과
연구 질문
- RQ1프롬프트 재작성과 시나리오 중첩의 일반화된 패턴이 다양한 LLM에서 잠금 풀기 성공률를 크게 향상시킬 수 있는가?
- RQ2의미 유지 재작성과 맥락 기반 중첩의 조합이 LLM의 주의 및 응답 행동에 어떤 영향을 미치는가?
- RQ3의미적으로 유창한데도 불구하고 현재 방어 조치가 ReNeLLM이 생성한 잠금 풀기 프롬프트를 차단하지 못하는 이유는 무엇인가?
- RQ4ReNeLLM이 기존 기준 대비 공격 성공률와 효율성에서 어느 정도 뛰어나게 성과를 내는가?
- RQ5중첩된 잠금 풀기 프롬프트 실행 중 LLM의 주의 메커니즘이 어떻게 변화하는가? 이는 모델의 안전성에 어떤 함의를 지닌다?
주요 결과
- ReNeLLM는 Llama-2-chat-70b에서 기준 방법보다 40퍼센트 이상 높은 공격 성공률를 달성하여 뚜렷한 성능 향상을 입증한다.
- GPT-3.5에서 프롬프트 재작성과 시나리오 중첩을 조합하면 성공률가 40퍼센트 이상 증가하여 두 구성 요소 간 강력한 상호보완 효과를 보인다.
- 주의 시각화 결과, 중첩 후 LLM이 외부 작업 지시어를 내부 악성 프롬프트보다 우선순위를 높여 처리함으로써 탐지 가능성은 감소한다.
- 퍼플렉서티 또는 의미 필터링 기반의 방어 조치는 ReNeLLM에 효과가 없으며, 재작성된 프롬프트가 높은 유창성과 일관성을 유지하기 때문이다.
- GCG와 같이 반복적 탐색과 기울기 계산이 필요한 최적화 기반 방법 대비 시간 비용을 크게 줄였다.
- 안전성 정렬을 위한 피팅 트레이닝이 적용된 LLM조차도 ReNeLLM의 일반화된 공격 패턴에 취약함을 드러내며, 현재 정렬 기법의 근본적인 약점을暴露한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.