Skip to main content
QUICK REVIEW

[논문 리뷰] Pandora: Jailbreak GPTs by Retrieval Augmented Generation Poisoning

Gelei Deng, Yi Liu|arXiv (Cornell University)|2024. 02. 13.
Imbalanced Data Classification Techniques인용 수 4
한 줄 요약

Pandora는 Retrieval-Augmented Generation(RAG)을 통한 악성 지식 소스 주입을 통해 GPT의 간접적 탈옥 공격을 제안한다. 이 공격는 악성으로 설계된 외부 지식 소스를 삽입하여 LLM의 응답을 조작한다. 이 방법은 GPT-3.5에서 64.3%의 성공률, GPT-4에서는 네 가지 금지된 콘텐츠 시나리오에서 34.8%의 성공률을 기록하며 직접 프롬프트 공격보다 뛰어난 성능을 보였다.

ABSTRACT

Large Language Models~(LLMs) have gained immense popularity and are being increasingly applied in various domains. Consequently, ensuring the security of these models is of paramount importance. Jailbreak attacks, which manipulate LLMs to generate malicious content, are recognized as a significant vulnerability. While existing research has predominantly focused on direct jailbreak attacks on LLMs, there has been limited exploration of indirect methods. The integration of various plugins into LLMs, notably Retrieval Augmented Generation~(RAG), which enables LLMs to incorporate external knowledge bases into their response generation such as GPTs, introduces new avenues for indirect jailbreak attacks. To fill this gap, we investigate indirect jailbreak attacks on LLMs, particularly GPTs, introducing a novel attack vector named Retrieval Augmented Generation Poisoning. This method, Pandora, exploits the synergy between LLMs and RAG through prompt manipulation to generate unexpected responses. Pandora uses maliciously crafted content to influence the RAG process, effectively initiating jailbreak attacks. Our preliminary tests show that Pandora successfully conducts jailbreak attacks in four different scenarios, achieving higher success rates than direct attacks, with 64.3\% for GPT-3.5 and 34.8\% for GPT-4.

연구 동기 및 목표

  • LLMs, 특히 GPT에 대한 간접적 탈옥 공격를 탐구하며, Retrieval-Augmented Generation(RAG)의 통합을 악용한다.
  • 외부 지식 기반을 조작하여 악성 LLM 행동을 유도하는 새로운 공격 벡터인 RAG 오염을 개발한다.
  • 오염된 RAG 콘텐츠를 통해 GPT를 탈옥하는 것이 가능하고, 직접 공격 방법을 초월하는 높은 성공률을 입증한다.
  • 성인, 해로운, 개인정보 침해, 불법 콘텐츠를 포함한 여러 금지된 콘텐츠 시나리오에서 이 공격의 효과를 평가한다.

제안 방법

  • 공격는 타겟 LLM이 검색할 때 탈옥 행동을 유도하도록 설계된 악성 콘텐츠를 포함하는 악성 지식 기반을 구성한다.
  • LLM이 오염된 RAG 콘텐츠를 검색하고 활용하도록 유도하기 위해 프롬프트 엔지니어링을 활용한다.
  • 특정 GPT 인스턴스를 생성하여 오염된 지식 기반을 통합함으로써 GPT에 대한 종단 간 탈옥 실행을 가능하게 한다.
  • 두 단계 프로세스를 사용한다: 첫째, RAG 지식 소스를 오염시키고, 둘째, 악성 콘텐츠를 검색하도록 유도하는 프롬프트를 제작한다.
  • 성인, 해로운, 개인정보 침해, 불법 콘텐츠를 포함한 네 가지 금지된 콘텐츠 카테고리에서 공격를 평가한다.
  • 이 프레임워크는 재사용 가능하고 확장 가능하도록 설계되어, 사용자가 오염된 GPT 인스턴스를 통해 탈옥된 GPT를 배포할 수 있다.

실험 결과

연구 질문

  • RQ1RAG 오염은 전통적인 안전 필터를 우회하는 GPT에 대한 실현 가능한 간접적 탈옥 벡터로 활용될 수 있는가?
  • RQ2GPT-3.5와 GPT-4에서 RAG 오염의 성공률은 직접 탈옥 공격보다 어떻게 비교되는가?
  • RQ3어느 금지된 콘텐츠 카테고리가 RAG 기반 탈옥에 가장 취약한가, 그리고 그 이유는 무엇인가?
  • RQ4모델 아키텍처(예: GPT-3.5 대비 GPT-4)는 RAG 오염의 효과성에 어떤 영향을 미치는가?
  • RQ5이 공격는 다수의 시험에서 일관되게 재현 가능한가, 즉 신뢰성과 내구성을 보장하는가?

주요 결과

  • Pandora는 네 가지 금지된 콘텐츠 시나리오에서 GPT-3.5의 64.3% 성공률을 기록하며 직접 공격보다 뚜렷이 뛰어난 성능을 보였다.
  • GPT-4의 성공률은 34.8%였으며, 이는 GPT-4에서 직접 공격가 1.0%의 성공률을 기록한 것과 비교해도 상당히 높았다.
  • 개인정보 침해 카테고리가 가장 취약했으며, 모든 모델과 시나리오에서 평균 35.3%의 성공률을 기록했다.
  • 공격는 다수의 실험 라운드에서 높은 재현성과 일관성을 보이며 신뢰성을 입증했다.
  • GPT-4 기반 챗봇과 GPT는 GPT-3.5 대비 더 높은 내성적 저항성을 보이며, 더 나은 정렬이 이루어졌음을 시사한다.
  • 결과적으로 RAG 오염은 LLM과 외부 지식 검색 간 상호보완적 상호작용을 악용하는 강력하고 확장 가능한 공격 벡터임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.