[논문 리뷰] FuzzLLM: A Novel and Universal Fuzzing Framework for Proactively Discovering Jailbreak Vulnerabilities in Large Language Models
FuzzLLM는 템플릿, 제약 조건, 금지된 질문을 사용하여 구조적으로 다양하게 변형된 프롬프트를 자동으로 생성함으로써 대규모 언어 모델(Large Language Models, LLMs)의 잠재적 탈옥 취약성을 사전에 탐지하는 새로운 유니버설 패치 프레임워크이다. 이 프레임워크는 GPT-3.5-turbo 및 GPT-4와 같은 최신 모델에서도 작은 테스트 세트로도 높은 효과를 발휘하여 단일 컴пон언트 공격보다 조합 공격 시나리오에서 뛰어난 성능을 보인다.
Jailbreak vulnerabilities in Large Language Models (LLMs), which exploit meticulously crafted prompts to elicit content that violates service guidelines, have captured the attention of research communities. While model owners can defend against individual jailbreak prompts through safety training strategies, this relatively passive approach struggles to handle the broader category of similar jailbreaks. To tackle this issue, we introduce FuzzLLM, an automated fuzzing framework designed to proactively test and discover jailbreak vulnerabilities in LLMs. We utilize templates to capture the structural integrity of a prompt and isolate key features of a jailbreak class as constraints. By integrating different base classes into powerful combo attacks and varying the elements of constraints and prohibited questions, FuzzLLM enables efficient testing with reduced manual effort. Extensive experiments demonstrate FuzzLLM's effectiveness and comprehensiveness in vulnerability discovery across various LLMs.
연구 동기 및 목표
- 현재 LLM 보안 방어가 공개된 후 개별 탈옥 공격를 수리하는 반응형 방식인 데에 대비해, 사전에 취약성을 탐지할 수 있는 능력을 제공하기 위해.
- LLM의 효과적인 안전성 미세조정을 제한하는 다양한 레이블이 부여된 탈옥 데이터의 부족 문제를 해결하기 위해.
- 모델 내부 접근 없이도 어떤 LLM에 대해서도 탈옥 취약성을 테스트할 수 있는 유니버설이고 자동화된 프레임워크를 개발하기 위해.
- 탈옥 공격를 재사용 가능한 구성 요소인 템플릿, 제약 조건, 질문 세트로 분해하여 다양하고 강력한 탈옥 프롬프트를 체계적으로 생성하기 위해.
- 역할 놀이(RP), 출력 제약(OC), 권한 상향(PE)과 같은 다양한 탈옥 유형을 조합한 공격가의 취약성 커버리지 범위를 평가하기 위해.
제안 방법
- FuzzLLM는 모델 내부 접근 없이 입력-출력 기반의 블랙박스 패치를 사용하여, 템플릿 기반 조합을 통해 탈옥 프롬프트를 생성한다.
- 탈옥 공격를 세 가지 핵심 구성 요소로 분해한다: 구조적 템플릿, 제약 조건 세트(성공적인 탈옥 공격의 핵심 특징), 금지된 질문 세트(정책 위반 질문).
- 기본 탈옥 유형 세 가지—역할 놀이(RP), 출력 제약(OC), 권한 상향(PE)—를 제약 조건과 질문을 혼합하여 강력한 조합 공격로 조합한다.
- 출력을 '나쁜'(탈옥됨) 또는 '좋은'(안전함)으로 자동 분류하기 위해 레이블 모델(Vicuna-13B 등)을 사용하며, 오류율을 측정하여 신뢰성 검증을 수행한다.
- 초기화 조건으로 테스트 세트 크기 Tes=300(각 클래스당), 온도=0.7, 최대 출력 토큰 수 tk=256를 설정하고, 결과는 세 개의 랜덤 시드 기반 평균을 취한다.
- 제거 분석을 통해 테스트 세트 크기와 출력 토큰 제한의 영향을 평가한 결과, 크기 변화에 따른 성능 변동이 미미하며, tk=64일 때 성공률이 역설적으로 상승하는 현상이 관찰되어 출력 길이에 대한 감도가 높은 것을 확인하였다.
실험 결과
연구 질문
- RQ1모델 내부 접근 없이 다양한 LLM에 대해 사전에 탈옥 취약성을 효과적으로 탐지할 수 있는 유니버설이고 자동화된 패치 프레임워크가 가능한가?
- RQ2역할 놀이(RP), 출력 제약(OC), 권한 상향(PE)과 같은 기본 탈옥 유형을 조합 공격으로 조합할 경우, 단일 컴포넌트 공격에 비해 취약성 탐지 성능이 어떻게 향상되는가?
- RQ3테스트 세트 크기와 출력 토큰 제한이 자동 레이블링을 통한 탈옥 탐지의 신뢰성과 성능에 어떤 영향을 미치는가?
- RQ4GPT-3.5-turbo 및 GPT-4와 같은 최신이고 강력한 보안 방어를 갖춘 LLM에서 FuzzLLM의 탈옥 탐지 능력은 얼마나 효과적인가?
- RQ5경량이고 오픈소스인 LLM이 수용 가능한 오류율을 유지하면서도 탈옥 성공 여부를 분류하는 데 신뢰할 수 있는 레이블 모델로 활용될 수 있는가?
주요 결과
- FuzzLLM는 GPT-3.5-turbo와 GPT-4의 고도화된 보안 방어에도 불구하고 탈옥 취약성을 성공적으로 탐지하여 사전 탐지 능력을 입증하였다.
- 다양한 기본 유형(RP, OC, PE)을 조합한 조합 공격는 GPT-4에서 19.61%의 탈옥 성공률 기록—단일 컴포넌트 공격(11.92%)보다 뚜렷이 높아, 더 넓은 커버리지와 높은 공격력이 있음을 시사한다.
- 레이블 모델인 Vicuna-13B는 테스트된 모델들 중에서 가장 낮은 오류율(4.08%)을 기록했으며(Bloom-7B: 14.35%, LLAMA-7B: 11.57%), 자동 레이블링의 신뢰성을 입증하였다.
- 제거 분석 결과, 테스트 세트 크기(50에서 500까지) 변화에 따른 성능 변동이 미미하여, 소규모 테스트에서도 결과가 안정적이고 일반화 가능함을 확인하였다.
- tk=64일 때 성공률이 82.26%로 급격히 상승하는 현상은 악성 질문만 존재할 경우 출력이 완전하지 않아 '나쁨'으로 잘못 분류되기 때문이며, 이는 탐지에 있어 출력 길이에 대한 민감도가 높다는 중요한 문제점을 드러낸다.
- GPT-3.5-turbo(23.57% 대 23.12%)와 GPT-4(19.61% 대 11.92%)에서 FuzzLLM는 조합 공격 모드에서 단일 컴포넌트 공격보다 뛰어난 성능을 보이며, 복합 공격 패tern의 효과성을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.