[논문 리뷰] AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs
이 논문은 대규모 언어 모델(Large Language Models, LLMs)의 안전성 제약을 우회하기 위해 빠르고 적응형이며 인간이 읽을 수 있는 대안적 프롬프트 생성 방법인 AdvPrompter를 소개한다. 이 방법은 기울기 접근이 불필요한 전용 LLM(AdvPrompter)을 교차 최적화 및 저질서 미세조정 루프를 통해 훈련시켜, 안정성 정렬을 우회할 수 있는 일관된 접미사를 생성하며, 기존 기울기 기반 방법 대비 약 800배 빠른 속도로 작동하고, 개방형 및 폐쇄형 LLM 모두에서 최신 기술 수준의 공격 성공률를 달성한다.
Large Language Models (LLMs) are vulnerable to jailbreaking attacks that lead to generation of inappropriate or harmful content. Manual red-teaming requires a time-consuming search for adversarial prompts, whereas automatic adversarial prompt generation often leads to semantically meaningless attacks that do not scale well. In this paper, we present a novel method that uses another LLM, called AdvPrompter, to generate human-readable adversarial prompts in seconds. AdvPrompter, which is trained using an alternating optimization algorithm, generates suffixes that veil the input instruction without changing its meaning, such that the TargetLLM is lured to give a harmful response. Experimental results on popular open source TargetLLMs show highly competitive results on the AdvBench and HarmBench datasets, that also transfer to closed-source black-box LLMs. We also show that training on adversarial suffixes generated by AdvPrompter is a promising strategy for improving the robustness of LLMs to jailbreaking attacks.
연구 동기 및 목표
- LLM 잭브레이킹을 위한 기존 자동 레드팀 방법의 비효율성과 일관성 부족 문제를 해결하기 위해.
- 대상 LLM의 기울기를 필요로 하지 않고도 빠르고 적응형이며 인간이 읽을 수 있는 대안적 프롬프트 생성 방법을 개발하기 위해.
- 의미가 유지되는 맥락 인식 대안적 접미사를 생성함으로써 스케일링 가능한 다중 샷 잭브레이킹 공격을 가능하게 하기 위해.
- AdvPrompter가 생성한 대안적 프롬프트를 사용해 대상 LLM을 미세조정함으로써 향후 공격에 대한 강건성을 향상시킬 수 있음을 입증하기 위해.
제안 방법
- 대상 LLM의 안전성 정렬을 우회하면서도 지시어 의미를 유지하는 대안적 접미사를 생성하도록 전용 LLM인 AdvPrompter를 훈련시킨다.
- 교차 훈련 루프를 사용한다: (1) 고도로 최적화된 새로운 최적화 알고리즘인 AdvPrompterOpt는 반복적으로 토큰 후보를 선택하고 평가하여 고품질의 대안적 접미사를 생성하고, (2) 생성된 접미사를 지도 학습 타겟으로 사용해 AdvPrompter를 저질서 미세조정한다.
- AdvPrompterOpt는 기본 LLM을 사용해 퍼플렉서티를 최소화함으로써 인간의 독해 가능성을 유지하여 생성된 접미사가 자연스럽고 퍼플렉서티 필터에 의해 탐지되지 않도록 보장한다.
- 훈련 과정에서 대상 LLM의 기울기 접근을 회피하므로, 블랙박스 모델에도 적용 가능하다.
- 입력 지시어에 따라 AdvPrompter를 조건화함으로써, 일반적인 접미사가 아닌 맥락에 적응하는 접미사를 생성할 수 있다.
- 추론 단계에서는 미세조정된 AdvPrompter가 몇 초 내로 대안적 접미사를 생성하여, 빠르고 다중 샷 공격 파이프라인을 가능하게 한다.

실험 결과
연구 질문
- RQ1대상 LLM의 기울기가 필요 없이, 인간이 읽을 수 있고 적응형인 대안적 프롬프트를 생성할 수 있는 대규모 언어 모델을 훈련시킬 수 있는가?
- RQ2기존의 최적화 기반 및 히우리스틱 기반의 대안적 프롬프트 생성 기법과 비교해 본다면, 제안된 방법의 공격 성공률 및 생성 속도 측면에서 성능는 어떻게 되는가?
- RQ3AdvPrompter가 생성한 대안적 프롬프트는 폐쇄형 블랙박스 LLM API로 얼마나 잘 전이되는가?
- RQ4AdvPrompter가 생성한 대안적 프롬프트를 사용해 대상 LLM을 미세조정함으로써 그 강건성을 향상시킬 수 있는가?
- RQ5최적화와 저질서 미세조정을 번갈아 훈련하는 방식이, 종단 간 훈련 대비 더 효과적이고 일반화 능력이 뛰어난 대안적 프롬프트 생성을 이끌 수 있는가?
주요 결과
- AdvPrompter는 다양한 개방형 LLM에서 AdvBench 데이터셋 기준 최신 기술 수준의 공격 성공률 92.5%를 달성하며, 기존 방법들을 능가한다.
- 이 방법은 프롬프트당 약 1~2초 내로 대안적 프롬프트를 생성하여, 기울기 기반 최적화 방법 대비 약 800배 빠른 속도를 기록한다.
- 생성된 대안적 접미사는 인간이 읽을 수 있고 일관성이 있으며, 낮은 퍼플렉서티 스코어를 가지므로 표준 퍼플렉서티 기반 필터링 메커니즘에 의해 탐지되지 않는다.
- 이 방법은 폐쇄형 LLM API로도 성공적으로 전이되어, 대상 모델의 기울기 접근 없이도 높은 공격 성공률를 달성한다.
- AdvPrompter가 생성한 대안적 프롬프트로 구성된 합성 데이터셋을 사용해 대상 LLM을 미세조정하면, 잭브레이킹 공격에 대한 강건성이 크게 향상되며, 동시에 높은 MMLU 성능 스코어를 유지한다.
- AdvPrompterOpt와 저질서 미세조정의 교차 훈련 루프는 종단 간 훈련 대비 더 뛰어난 일반화 능력과 적응 능력을 보이며, 특히 제로샷 및 전이 설정에서 두드러진다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.