[논문 리뷰] PAL: Proxy-Guided Black-Box Attack on Large Language Models
이 논문은 실제 릴리스된 LLM API에 대한 최초의 최적화 기반 블랙박스 해킹 공격인 PAL (Proxy-Guided Attack on Large Language Models)을 소개한다. 이는 사전 학습된 오픈소스 모델을 사용해 기울기 기반 토큰 수준 최적화를 안내하고, 실제 API 동작에 맞게 설계된 새로운 손실 함수를 적용하여 GPT-3.5-Turbo에서 84%의 공격 성공률, Llama-2-7B에서 48%의 성공률를 기록하며 이전 최고 성능 기법들을 크게 능가한다.
Large Language Models (LLMs) have surged in popularity in recent months, but they have demonstrated concerning capabilities to generate harmful content when manipulated. While techniques like safety fine-tuning aim to minimize harmful use, recent works have shown that LLMs remain vulnerable to attacks that elicit toxic responses. In this work, we introduce the Proxy-Guided Attack on LLMs (PAL), the first optimization-based attack on LLMs in a black-box query-only setting. In particular, it relies on a surrogate model to guide the optimization and a sophisticated loss designed for real-world LLM APIs. Our attack achieves 84% attack success rate (ASR) on GPT-3.5-Turbo and 48% on Llama-2-7B, compared to 4% for the current state of the art. We also propose GCG++, an improvement to the GCG attack that reaches 94% ASR on white-box Llama-2-7B, and the Random-Search Attack on LLMs (RAL), a strong but simple baseline for query-based attacks. We believe the techniques proposed in this work will enable more comprehensive safety testing of LLMs and, in the long term, the development of better security guardrails. The code can be found at https://github.com/chawins/pal.
연구 동기 및 목표
- 사용자에게만 열려 있는 블랙박스 API를 통해 접근 가능한 기업용 LLM의 실용적이고 효율적인 안전성 평가의 필수적인 필요성을 해결하기 위해.
- 기존의 랜덤 서치나 유전 알고리즘에 의존하는 쿼리 기반 공격의 한계를 극복하여, 비효율적이고 효과가 떨어지는 방식을 개선하기 위해.
- 안전성 퍼포먼스가 조정된 LLM을 해킹하기 위한 확장 가능하고 저비용의 방법을 개발하여 포괄적인 레드팀 테스트 및 보다 나은 보안 가드레일 개발을 가능하게 하기 위해.
- GCG 화이트박스 공격을 향상시켜 Llama-2-7B와 같은 강력한 모델에서도 높은 성공률을 확보하기 위해 GCG++를 도입하기 위해.
- 최소한의 비용으로도 놀랍게 효과적인 성능을 보이는 랜덤 서치 기반 공격인 RAL (Random-Search Attack on LLMs)을 제안하여 쿼리 기반 공격의 강력한 베이스라인을 설정하기 위해.
제안 방법
- 공개된 오픈소스 프oxy 모델(예: Llama-2)을 활용해 공격 대상 LLM의 기울기를 유도하는 방식으로, 악성 프롬프트 최적화를 안내한다.
- 기울기 기반 토큰 수준 최적화를 적용하여 안전성 정렬 메커니즘을 회피하는 프롬프트 서픽스를 반복적으로 개선한다.
- 실제 LLM API와의 상호작용을 고려해 설계된 새로운 손실 함수를 사용하여, 비가환적인 출력과 모델의 거부 반응 행동을 반영한다.
- 쿼리 효율성 전략을 적용: 프oxy 모델이 검색을 안내함으로써, 대상 LLM API에 대한 고비용 호출 수를 최소화한다.
- Greedy Coordinate Gradient (GCG) 공격의 개선된 버전인 GCG++를 도입하여, 향상된 최적화 히우리스틱과 손실 함수 설계를 통합한다.
- 기울기 안내를 대체해 프롬프트 토큰에 대한 무작위 서치를 수행하는 단순하지만 효과적인 기반선인 RAL (Random-Search Attack on LLMs)을 제안한다.

실험 결과
연구 질문
- RQ1기울기가 제공되지 않는 실제 블랙박스 환경에서, 프oxy 모델 기반 최적화 공격이 높은 성공률을 달성할 수 있는가?
- RQ2대상 모델의 기울기를 직접 접근할 수 없을 때, 사전 모델이 악성 프롬프트 탐색에 얼마나 효과적으로 기여하는가?
- RQ3비가환적인 출력이나 비결정적인 출력을 보일 수 있는 실제 LLM API와 상호작용할 때, 어떤 손실 함수 설계가 공격 성공률를 최대화하는가?
- RQ4제안된 방법이 기업용 및 오픈웨이트 LLM 모두에서 기존의 쿼리 기반 공격 대비 성공률 및 비용 효율성 측면에서 뚜렷이 뛰어나게 성능을 발휘할 수 있는가?
- RQ5블랙박스 LLM 해킹 환경에서, 단순한 랜덤 서치가 더 복잡한 최적화 방법의 성능을 얼마나 잘 따라하거나 초월할 수 있는가?
주요 결과
- PAL은 GPT-3.5-Turbo-1106에서 84%의 공격 성공률를 기록했으며, 이는 이전 최고 기록인 58% 대비 28% 향상된 성과이며, 비용은 절반 수준이다.
- Llama-2-7B에서는 PAL이 48%의 공격 성공률를 달성했으며, 이는 이전 최고 기록인 4%에 비해 극적으로 뛰어난 성능이다.
- GPT-3.5-Turbo에서 성공적인 해킹을 찾는 데 평균적으로 0.88달러의 비용만 소요되어 높은 비용 효율성을 입증했다.
- RAL은 Llama-2-7B에서 25,000회 이내의 쿼리로 26%의 공격 성공률를 기록했으며, 향후 연구를 위한 강력한 기반선을 확립했다.
- GCG++는 원래 GCG 화이트박스 공격의 성공률를 Llama-2-7B에서 56%에서 80%로 향상시켜, 정교한 최적화 기법의 가치를 입증했다.
- 연구 결과, 대상 모델에 대한 접근이 제한되어 있어도, 프oxy 기반 최적화는 현대 LLM의 안전성 정렬 메커니즘을 효과적으로 우회할 수 있음을 입증했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.