[논문 리뷰] Bergeron: Combating Adversarial Attacks through a Conscience-Based Alignment Framework
Bergeron은 주된 LLM의 위험한 입력과 출력을 모니터링하고 수정하는 보조적인 '양심' 모델을 갖춘 이중 구조의 LLM 프레임워크를 제안한다. 이는 피지컬 튜닝 없이도 적대적 공격에 대한 강건성을 크게 향상시키며, GPT-3.5, Llama2-7B, Mistral-7B 등 여러 모델에서 실패율을 감소시킨다. 특히 쉘 에뮬레이션 및 목록 완성과 같은 고위험 프롬프트에서 뚜렷한 성능 향상을 보였다.
Research into AI alignment has grown considerably since the recent introduction of increasingly capable Large Language Models (LLMs). Unfortunately, modern methods of alignment still fail to fully prevent harmful responses when models are deliberately attacked. Such vulnerabilities can lead to LLMs being manipulated into generating hazardous content: from instructions for creating dangerous materials to inciting violence or endorsing unethical behaviors. To help mitigate this issue, we introduce Bergeron: a framework designed to improve the robustness of LLMs against attacks without any additional parameter fine-tuning. Bergeron is organized into two tiers; with a secondary LLM acting as a guardian to the primary LLM. This framework better safeguards the primary model against incoming attacks while monitoring its output for any harmful content. Empirical analysis reviews that by using Bergeron to complement models with existing alignment training, we can significantly improve the robustness and safety of multiple, commonly used commercial and open-source LLMs. Specifically, we found that models integrated with Bergeron are, on average, nearly seven times more resistant to attacks compared to models without such support.
연구 동기 및 목표
- 기존의 정렬 기법이 무시하는 적대적 프롬프트에 대한 대비가 되지 않는 대규모 언어 모델의 지속적인 취약성을 해결한다.
- 비용이 많이 들고 불완전하며 모델 성능을 저하시킬 수 있는 RLHF와 같은 가중치 기반 정렬 기법의 한계를 극복한다.
- 기본 모델을 재학습하지 않고도 정렬을 향상시킬 수 있는 모듈식이고 침습적이지 않은 프레임워크를 개발한다.
- 외부의 투명한 감시 레이어를 추가함으로써 오픈소스 및 블랙박스 LLM 모두의 안전성을 향상시킨다.
- 보조 LLM이 주 모델의 출력과 입력을 실시간으로 해석 가능한 보호 장치로 기능할 수 있음을 입증한다.
제안 방법
- 주 LLM의 입력 프롬프트와 생성된 출력을 모니터링하기 위해 보조 LLM을 '양심'으로 활용한다.
- 일반 텍스트로 구성된 비판을 사용해 실시간으로 위험한 콘텐츠를 탐지하고 수정한다.
- 두 단계의 보호 메커니즘을 적용한다: 생성 전 프롬프트 수정과 생성 후 응답 수정.
- GPT-4를 심판 모델로 활용해 응답의 안전성을 평가하며, 정렬 성공/실패 예시를 포함한 3샷 프롬프트를 사용한다.
- 기본 모델의 원래 동작에 최소한의 간섭을 주는 웨이퍼 형태로 프레임워크를 구현한다.
- 반복적인 수정 메커니즘을 활용해 비판을 다수 번 적용할 수 있지만, 현재 평가에서는 단일 호출만을 사용한다.
실험 결과
연구 질문
- RQ1피지컬 튜닝 없이도 보조 LLM이 주 LLM의 프롬프트와 응답에서 위험한 콘텐츠를 효과적으로 탐지하고 수정할 수 있는가?
- RQ2GPT-3.5와 Mistral-7B처럼 사전 정렬 수준이 다른 모델들에서 Bergeron 프레임워크의 성능은 어떻게 달라지는가?
- RQ3모델 크기와 사전 정렬 수준이 양심 기반 프레임워크의 효과성에 어떤 영향을 미치는가?
- RQ4어느 정도의 적대적 프롬프팅 기법이 이 프레임워크를 가장 효과적으로 우회할 수 있으며, 그 이유는 무엇인가?
- RQ5쉘 에뮬레이션, 목록 완성, 항상 마키아벨리즘 프롬프트 등 다양한 공격 유형에서 프레임워크의 성능은 원본 모델과 비교해 어떻게 되는가?
주요 결과
- Bergeron 프레임워크는 평가된 모든 모델에서 실패율을 감소시켰으며, 특히 GPT-3.5에서 모든 공격 유형에서 실패율이 크게 하락했다.
- Llama2-7B는 목록 완성 공격에 더 취약했지만, GPT-3.5는 쉘 에뮬레이션 프롬프트에 더 취약했으나, Bergeron은 양쪽 모두를 효과적으로 완화했다.
- Mistral-7B는 사전 정렬 피지컬 튜닝이 거의 없음에도 불구하고 실패율이 4%에서 11% 감소하여, 정렬 수준이 낮은 모델에도 프레임워크의 효과가 있음을 보여주었다.
- 강력한 사전 정렬이 구현된 대규모 블랙박스 모델에서 프레임워크가 가장 뛰어난 성능을 보였으며, 이는 가중치 기반 정렬과 양심 기반 정렬 간의 상호보완적 상호작용을 시사한다.
- GPT-4가 출력을 위험하다고 판단한 모든 케이스에서 양심 모델이 위험한 콘텐츠를 100% 정확하게 탐지하고 수정했다. 이는 높은 탐지 정확도를 입증한다.
- Always Machiavellian, Shell Emulation, List Completion 등 다양한 공격 유형에서 프레임워크가 뛰어난 강건성을 유지했다. 이는 광범위한 강건성을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.