Skip to main content
QUICK REVIEW

[논문 리뷰] AutoDAN: Interpretable Gradient-Based Adversarial Attacks on Large Language Models

Sicheng Zhu, Ruiyi Zhang|arXiv (Cornell University)|2023. 10. 23.
Topic Modeling인용 수 5
한 줄 요약

AutoDAN은 대규모 언어 모델에 대해 해석 가능하고 기울기 기반의 새로운 악성 공격을 제안하며, 왼쪽에서 오른쪽으로 순차적으로 토큰을 최적화하여 인간이 읽을 수 있고 높은 성공률을 보이는 탈옥 프롬프트를 생성한다. 기존 방법들이 난숙어나 수동으로 제작한 프롬프트에 의존하는 데 반해, AutoDAN은 낮은 퍼플렉서티를 유지하면서도 블랙박스 모델 간에 강한 전이성과 높은 독해성과 효과성을 동시에 확보하며, 자동으로 시스템 프롬프트 泄露를 가능하게 한다.

ABSTRACT

Safety alignment of Large Language Models (LLMs) can be compromised with manual jailbreak attacks and (automatic) adversarial attacks. Recent studies suggest that defending against these attacks is possible: adversarial attacks generate unlimited but unreadable gibberish prompts, detectable by perplexity-based filters; manual jailbreak attacks craft readable prompts, but their limited number due to the necessity of human creativity allows for easy blocking. In this paper, we show that these solutions may be too optimistic. We introduce AutoDAN, an interpretable, gradient-based adversarial attack that merges the strengths of both attack types. Guided by the dual goals of jailbreak and readability, AutoDAN optimizes and generates tokens one by one from left to right, resulting in readable prompts that bypass perplexity filters while maintaining high attack success rates. Notably, these prompts, generated from scratch using gradients, are interpretable and diverse, with emerging strategies commonly seen in manual jailbreak attacks. They also generalize to unforeseen harmful behaviors and transfer to black-box LLMs better than their unreadable counterparts when using limited training data or a single proxy model. Furthermore, we show the versatility of AutoDAN by automatically leaking system prompts using a customized objective. Our work offers a new way to red-team LLMs and understand jailbreak mechanisms via interpretability.

연구 동기 및 목표

  • 기존의 공격 방법이 읽기 어려운, 퍼플렉서티 기반 필터로 탐지 가능한 프롬프트를 생성하는 데서 비롯하는 한계를 해결하기 위해.
  • 수동 탈옥(독해성은 높지만 희소함)과 자동 공격(독해성은 낮지만 스케일 가능함) 사이의 격차를 메우기 위해.
  • 사전에 작업에 특화된 지식 없이도 해석 가능하고 전이성 있으며 효과적인 탈옥 프롬프트를 생성하는 기울기 기반 방법을 개발하기 위해.
  • 맞춤형 최적화 목표를 통해 자동으로 시스템 프롬프트를 泄露할 수 있도록 하기 위해.
  • 수동으로 설계된 탈옥 전략을 반영한 다양하고 해석 가능한 공격 전략을 생성함으로써 레드팀 능력을 향상시키기 위해.

제안 방법

  • AutoDAN은 자동회귀 언어 생성을 모방하여 왼쪽에서 오른쪽으로 토큰 단위로 공격 프롬프트를 생성함으로써 최적화 복잡도를 감소시킨다.
  • 각 토큰에 대해 두 단계 최적화 과정을 적용한다: 초기 후보군 탐색을 위한 예비 단계와 탈옥 성공률와 독해성 간 균형을 맞추기 위한 정밀 조정 단계.
  • 탈옥 성공률와 퍼플렉서티(독해성)의 가중 조합이 기울기 기반 최적화를 이끄며, 토큰 엔트로피에 따라 적응적으로 조정된다.
  • 단일 화이트박스 프oxy 모델을 사용하여, GPT-3.5 및 GPT-4와 같은 블랙박스 LLM에 잘 일반화되는 프롬프트를 생성한다.
  • 시스템 프롬프트 泄露를 위해 맞춤형 목표 함수를 적용하여 숨겨진 시스템 지침을 직접 추출하도록 최적화한다.
  • 이 방법은 완전히 자동화되어 있으며, 사전에 알려진 탈옥 템플릿이나 수동으로 설계된 전략이 필요하지 않다.

실험 결과

연구 질문

  • RQ1기울기 기반 최적화가 퍼플렉서티 기반 필터를 우회할 수 있는 해석 가능하고 독해하기 쉬운 악성 프롬프트를 생성할 수 있는가?
  • RQ2자동 공격 방법이 수동 공격의 장점(높은 독해성)과 자동 공격의 장점(확장성)을 모두 확보하며 높은 공격 성공률를 달성할 수 있는가?
  • RQ3AutoDAN이 생성한 프롬프트는 전통적인 악성 공격 대비 블랙박스 LLM으로 얼마나 잘 전이되는가?
  • RQ4AutoDAN은 숨겨진 시스템 지침을 자동으로 유출할 수 있는 프롬프트를 생성할 수 있는가?
  • RQ5생성된 프롬프트는 수동 탈옥에서 흔히 볼 수 있는 다양한, 해석 가능한 전략(예: 역할 놀이, 지시 조작 등)을 보여주는가?

주요 결과

  • AutoDAN이 생성한 프롬프트는 Vicuna 7B에서 90% 이상의 높은 공격 성공률를 달성하면서도 낮은 퍼플렉서티를 유지하여 성공률-퍼플렉서티 트레이드오프 공간의 좌상단에 집중된다.
  • 퍼플렉서티 정규화를 적용한 GCG-reg보다 독해성과 공격 성공률 모두에서 우월하며, 특히 낮은 정규화 가중치 조건에서 두드러진다.
  • GCG에서 생성된 독해하기 어려운 프롬프트와는 달리, AutoDAN은 단일 프oxy 모델로 훈련된 후에도 GPT-3.5 및 GPT-4와 같은 블랙박스 모델로의 일반화 능력이 뛰어나다.
  • AutoDAN이 생성한 프롬프트는 수동 탈옥에서 흔히 볼 수 있는 다양한 해석 가능한 전략(예: 역할 놀이, 지시 조작 등)을 보여주며, 인간이 설계한 전략과 유사한 방식을 취한다.
  • 맞춤형 목표 함수를 통해 AutoDAN은 시스템 프롬프트를 성공적으로 유출하였으며, 이는 표준 탈옥 작업을 넘어서는 유연성을 입증한다.
  • 수동 프리픽스/서픽스를 통합한 Semi-AutoDAN은 공격 효과성에 손상 없이 프롬프트 품질과 스타일 제어 능력을 더욱 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.