[논문 리뷰] Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM
이 논문은 몬테카를로 샘플링과 무작위 토큰 제거를 통해 테스트 입력의 강건성을 평가함으로써 기존에 정렬된 LLM에 대한 정렬 파괴 공격에 대한 내성을 향상시키는 방식으로, 재학습 없이도 공격 성공률을 거의 100%에서 10% 미만으로 낮추는 Robustly Aligned LLM (RA-LLM)을 제안한다. 이 방법은 모델의 내재된 정렬 능력을 활용하면서도 적대적 프롬프트에 대한 저항성을 강화한다.
Recently, Large Language Models (LLMs) have made significant advancements and are now widely used across various domains. Unfortunately, there has been a rising concern that LLMs can be misused to generate harmful or malicious content. Though a line of research has focused on aligning LLMs with human values and preventing them from producing inappropriate content, such alignments are usually vulnerable and can be bypassed by alignment-breaking attacks via adversarially optimized or handcrafted jailbreaking prompts. In this work, we introduce a Robustly Aligned LLM (RA-LLM) to defend against potential alignment-breaking attacks. RA-LLM can be directly constructed upon an existing aligned LLM with a robust alignment checking function, without requiring any expensive retraining or fine-tuning process of the original LLM. Furthermore, we also provide a theoretical analysis for RA-LLM to verify its effectiveness in defending against alignment-breaking attacks. Through real-world experiments on open-source large language models, we demonstrate that RA-LLM can successfully defend against both state-of-the-art adversarial prompts and popular handcrafted jailbreaking prompts by reducing their attack success rates from nearly 100% to around 10% or less.
연구 동기 및 목표
- 적대적 또는 수작업으로 제작된 잠금 해제 프롬프트를 이용한 정렬 파괴 공격에 취약한 정렬된 LLM의 취약점을 해결하기 위해.
- 재학습이나 피니테이닝 없이도 기존에 정렬된 LLM의 강건성을 향상시키는 방어 메커니즘을 설계하기 위해.
- 해로운 콘텐츠 외에도 다양한 정렬 유형(예: 해로운, 윤리적, 개인정보 관련)에 대해 효과적이며, 단지 해로운 콘텐츠에 국한되지 않도록 보장하기 위해.
- 실제 환경에 구현 가능한 이론적으로 타당하고 계산적으로 실현 가능한 방법을 제공하기 위해.
제안 방법
- RA-LLM는 입력 프롬프트에 대해 몬테카를로 샘플링을 적용하며, 각 샘플에서 랜덤한 토큰 부분을 제거한다.
- 모델의 응답을 다수의 샘플된 입력에 대해 평가하여, 유해한 요청을 일관되게 거부하는지 확인한다.
- 요청이 다수의 샘플 입력에서 거부될 경우에만 악성으로 분류되지 않으며, 이는 소규모 변형에 대한 강건성을 보장한다.
- 방어는 임계값 기반 결정 규칙을 사용한다: 모델이 n번의 시험 중 t번 이상 요청을 거부하면 안전한 것으로 간주한다.
- 외부 해로운 콘텐츠 검출기 필요 없이, 오직 모델의 내부 정렬 능력에 의존한다.
- 드롭아웃 비율(p), 몬테카를로 시도 수(n), 거부 임계값(t)과 같은 하이퍼파라미터는 성능과 계산 비용 간의 균형을 맞추기 위해 조정된다.
실험 결과
연구 질문
- RQ1재학습이나 피니테이닝 없이도 기존에 정렬된 LLM을 정렬 파괴 공격에 대해 강건하게 만들 수 있는 방어 메커니즘이 설계될 수 있는가?
- RQ2무작위 토큰 제거가 적대적 프롬프트 및 수작업으로 제작된 잠금 해제 프롬프트에 대한 모델의 강건성 향상에 얼마나 효과적인가?
- RQ3제안된 방법은 양성 요청 처리 능력을 유지하면서 공격 성공률를 얼마나 낮출 수 있는가?
- RQ4이 방어 메커니즘의 계산 오버헤드는 얼마이며, 실용적 구현을 위해 최적화될 수 있는가?
- RQ5무작위 제거 과정의 비미분성으로 인해 기울기 기반 공격 방법에 대해 방어가 강건한가?
주요 결과
- RA-LLM에 의해 방어된 최신 기술의 적대적 프롬프트 공격 성공률가 거의 100%에서 10% 미만으로 감소했다.
- 수작업으로 제작된 잠금 해제 프롬프트의 성공률 역시 크게 감소하여, 다양한 공격 유형에 대한 강건성이 확인되었다.
- 단 10회의 몬테카를로 시도만으로도 RA-LLM이 양성 응답률을 95% 이상 유지하고 공격 성공률를 15% 이하로 낮췄다.
- 이 방어 방법은 GPT-4 기준 약 1.25배, GPT-3.5 Turbo 기준 약 1.5배의 계산 비용 증가를 초래했으며, 이는 방어 성능 향상에 비해 합리적인 수준으로 간주된다.
- 비미분성의 특성 덕분에 무작위 제거 과정으로 인해 기울기 기반 공격의 효과가 제한되어, 기울기 기반 공격에 대해 방어가 강건하다.
- 아블레이션 연구를 통해 p, t, n와 같은 하이퍼파라미터 조정이 성능과 계산 비용 간의 트레이드오프를 가능하게 함을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.