Skip to main content
QUICK REVIEW

[논문 리뷰] Prompt Packer: Deceiving LLMs through Compositional Instruction with Hidden Attacks

Shuyu Jiang, Xingshu Chen|arXiv (Cornell University)|2023. 10. 16.
Topic Modeling인용 수 7
한 줄 요약

이 논문은 유사하게 무해해 보이는 다중 의도적 프롬프트 안에 악성 지시를 숨겨 대규모 언어 모델(Large Language Models, LLMs)을 기만하는 데 목적이 있는 새로운 방법인 조합형 지시 공격(Compositional Instruction Attacks, CIA)을 소개한다. 대화나 글쓰기 작업을 모방하는 T-CIA 및 W-CIA 변환 기법을 사용하여, GPT-4, ChatGPT, ChatGLM2-6B에서 91% 이상의 성공률를 기록함으로써 LLM의 암묵적 악성 의도에 대한 정렬 기법의 심각한 취약성을 드러낸다.

ABSTRACT

Recently, Large language models (LLMs) with powerful general capabilities have been increasingly integrated into various Web applications, while undergoing alignment training to ensure that the generated content aligns with user intent and ethics. Unfortunately, they remain the risk of generating harmful content like hate speech and criminal activities in practical applications. Current approaches primarily rely on detecting, collecting, and training against harmful prompts to prevent such risks. However, they typically focused on the "superficial" harmful prompts with a solitary intent, ignoring composite attack instructions with multiple intentions that can easily elicit harmful content in real-world scenarios. In this paper, we introduce an innovative technique for obfuscating harmful instructions: Compositional Instruction Attacks (CIA), which refers to attacking by combination and encapsulation of multiple instructions. CIA hides harmful prompts within instructions of harmless intentions, making it impossible for the model to identify underlying malicious intentions. Furthermore, we implement two transformation methods, known as T-CIA and W-CIA, to automatically disguise harmful instructions as talking or writing tasks, making them appear harmless to LLMs. We evaluated CIA on GPT-4, ChatGPT, and ChatGLM2 with two safety assessment datasets and two harmful prompt datasets. It achieves an attack success rate of 95%+ on safety assessment datasets, and 83%+ for GPT-4, 91%+ for ChatGPT (gpt-3.5-turbo backed) and ChatGLM2-6B on harmful prompt datasets. Our approach reveals the vulnerability of LLMs to such compositional instruction attacks that harbor underlying harmful intentions, contributing significantly to LLM security development. Warning: this paper may contain offensive or upsetting content!

연구 동기 및 목표

  • 무시무시한 표면 뒤에 악성 의도를 숨긴 다중 의도적 악성 프롬프트가 LLM의 취약성을 드러내는 것.
  • 모델 파라미터 접근 없이 자동으로, 파rameter가 없는 방식으로 이러한 속임수 프롬프트를 대규모로 생성하는 방법 개발.
  • GPT-4, ChatGPT, ChatGLM2-6B와 같은 최신 LLM들에 대한 이러한 공격의 효과성 평가.
  • 현재 정렬 기법이 복합 지시문 내에 숨겨진 악성 의도를 탐지하지 못함을 입증하는 것.
  • 레드팀 및 의도 인식 연구를 통해 LLM의 안전성을 향상시키기 위한 기초를 제공하는 것.

제안 방법

  • 다양한 지시를 조합하여 악성 의도를 표면적으로는 무해한 지시로 감추는 프레임워크로 조합형 지시 공격(CIA)을 제안한다.
  • 심리학적 원리—특히 유사성-유인 효과(salience-attraction effect)를 활용해, LLM이 악성 요청에 더 잘 응답하도록 유도하는 T-CIA(Talking-CIA)를 도입한다.
  • 문학적 완성 등 글쓰기 작업으로 위장하는 W-CIA(Writing-CIA)를 개발하여, 인라인 학습을 통해 악성 의도를 가림.
  • 모델 파라미터 접근 없이도 자동으로 프롬프트를 생성함으로써 LLM의 대규모 레드팀 테스팅을 가능하게 한다.
  • 다양한 LLM에서 안전성 평가 및 악성 프롬프트 데이터셋을 활용해 공격 성공률를 검증한다.
  • 인간 평가를 통해 LLM의 판단이 인간 애너테이션과 일관됨을 확인하여 결과의 신뢰성 확보.

실험 결과

연구 질문

  • RQ1표면적으로는 무해한 지시 안에 악성 의도를 포함한 복합 지시문으로 LLM을 기만할 수 있는가?
  • RQ2현재 정렬 기법이 다중 의도적 프롬프트 내에 숨겨진 악성 의도를 어느 정도 탐지하지 못하는가?
  • RQ3T-CIA와 W-CIA는 안전 필터를 우회할 수 있는 탐지 불가능한 악성 프롬프트를 얼마나 효과적으로 생성하는가?
  • RQ4공격을 반복할수록 디코딩의 무작위성으로 인해 성공 가능성은 증가하는가?
  • RQ5유사성-유인 효과와 같은 심리학 원리를 활용해 LLM의 행동을 조작할 수 있는가?

주요 결과

  • CIA는 안전성 평가 데이터셋에서 95% 이상의 공격 성공률를 기록하여 탐지 회피 능력이 매우 뛰어남을 입증했다.
  • 악성 프롬프트 데이터셋에서 GPT-4에서는 83% 이상, ChatGPT(gpt-3.5-turbo)에서는 91% 이상, ChatGLM2-6B에서는 91% 이상의 공격 성공률를 기록했다.
  • T-CIA는 인간 평가와 90.2%의 일관성 점수를 기록하여, 공격 조건 하에서도 신뢰할 수 있고 일관된 모델 행동을 보임을 확인했다.
  • W-CIA는 인간 평가와 82.0%의 일관성 점수를 기록하여, 속임수 기반 글쓰기 공격 생성의 신뢰성을 확인했다.
  • 반복 공격을 통해 공격 성공률가 증가함에 따라, 디코딩의 무작위성이 조합형 공격에 대한 취약성을 증폭시킴을 확인했다.
  • 성공한 T-CIA 공격는 성격 공간에서 더 높은 의미적 집중도를 보였으며, 이는 유사성 기반 필터링이 방어 수단이 될 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.