Skip to main content
QUICK REVIEW

[논문 리뷰] Ignore Previous Prompt: Attack Techniques For Language Models

Fábio Perez, Ian Ribeiro|arXiv (Cornell University)|2022. 11. 17.
Adversarial Robustness in Machine Learning인용 수 74
한 줄 요약

이 논문은 PromptInject를 도입하여 LLM에 대한 프롬프트 주입 공격을 연구하는 프레임워크를 소개하고, 두 가지 공격 유형—목표 하이재킹(goal hijacking)과 프롬프트 누출(prompt leaking)—을 상세히 설명하며, 다양한 설정에서 GPT-3 계열 모델이 이 공격에 상당히 취약하다는 실증적 결과를 제공합니다.

ABSTRACT

Transformer-based large language models (LLMs) provide a powerful foundation for natural language tasks in large-scale customer-facing applications. However, studies that explore their vulnerabilities emerging from malicious user interaction are scarce. By proposing PromptInject, a prosaic alignment framework for mask-based iterative adversarial prompt composition, we examine how GPT-3, the most widely deployed language model in production, can be easily misaligned by simple handcrafted inputs. In particular, we investigate two types of attacks -- goal hijacking and prompt leaking -- and demonstrate that even low-aptitude, but sufficiently ill-intentioned agents, can easily exploit GPT-3's stochastic nature, creating long-tail risks. The code for PromptInject is available at https://github.com/agencyenterprise/PromptInject.

연구 동기 및 목표

  • 생산 환경에 근접한 설정에서 LLM에 대한 적대적 프롬프트 공격 연구를 동기 부여하고 형식화한다.
  • 프롬프트 주입 공격을 구성하고 평가하기 위한 모듈식 프레임워크로 PromptInject를 제안한다.
  • 가능한 공격 벡터(목표 하이재킹 및 프롬프트 누출)를 특성화하고 공격 성공에 영향을 주는 요인을 식별한다.
  • 프롬프트와 모델 설정 전반에서 실증적 결과를 제공하여 더 안전한 프롬프트 설계 실천에 정보를 제공한다.]
  • method: ["기본 프롬프트, 공격 프롬프트, 사적 값, 구분자를 포함하는 모듈식 프롬프트 구성 프레임워크(PromptInject)를 정의한다.","다수의 하이퍼파라미터를 갖는 35개의 기본 프롬프트에 대해 text-davinci-002를 사용하여 목표 하이재킹과 프롬프트 누출을 실험적으로 평가한다.","정확 일치로 목표 하이재킹의 공격 성공을 측정하고, 프롬프트 누출의 경우 원래 프롬프트의 포함 여부를 측정하며, 퍼지 매칭 고려도 고려한다.","공격 효율성에 영향을 주는 요인들(구분자, 로지 문자열, 온도, 중지 시퀀스, user_input 이후 텍스트 등)을 모델 설정에 따라 분석한다.","위험 분석(x-risk)을 보고하고 콘텐츠 관리나 이중 매개변수 안전 제어와 같은 완화 방안을 논의한다."]
  • research_questions: [
  • LLM이 프롬프트를 해킹하는 적대적 주입(목표 하이재킹)이나 원래 프롬프트를 누출하는 프롬프트 누출에 얼마나 취약한가?
  • 어떤 프롬프트 설계나 모델 설정이 이러한 공격의 성공률을 증가시키거나 감소시키는가?
  • 생산 등급의 프롬프트와 설정이 간단한 수작업적 적대 입력에 어느 정도 버틸 수 있는가?
  • 배포된 LLM 애플리케이션에서 이러한 프롬프트 주입 위험을 줄일 수 있는 실용적 완화 방법은 무엇인가?

제안 방법

  • 모듈식 프롬프트 구성 프레임워크(PromptInject)를 정의하며 기본 프롬프트, 공격 프롬프트, 비공개 값, 구분자를 포함한다.
  • text-davinci-002를 사용하여 35개의 기본 프롬프트에 걸쳐 다수의 하이퍼파라미터를 적용해 목표 하이재킹과 프롬프트 누출을 실험적으로 평가한다.
  • 목표 하이재킹은 정확 매치로, 프롬프트 누출은 원래 프롈프트의 포함 여부로 공격 성공을 측정하고 퍼지 매칭의 고려도 함께 평가한다.
  • 공격 효과에 영향을 주는 요인들(구분자, 로지 문자열, 온도, Stop 시퀀스, user_input 이후 텍스트 등)을 다양한 모델 설정에서 분석한다.
  • 리스크 분석(x-risk)을 보고하고 콘텐츠 관리나 이중 매개변수 안전 설계와 같은 완화 방안을 논의한다.

실험 결과

연구 질문

  • RQ1LLM이 프롬프트를 해킹하는 적대적 주입(목표 하이재킹)이나 원래 프롬프트를 누출하는 프롬프트 누출에 얼마나 취약한가?
  • RQ2어떤 프롬 prompt 설계나 모델 설정이 이러한 공격의 성공률을 증가시키거나 감소시키는가?
  • RQ3생산 등급의 프롬프트와 설정이 간단한 수작업적 적대 입력에 어느 정도 버틸 수 있는가?
  • RQ4배포된 LLM 애플리케이션에서 이러한 프롘프트 주입 위험을 줄일 수 있는 실용적 완화 방법은 무엇인가?

주요 결과

  • 목표 하이재킹은 특정 프롬프트 및 설정에서 약 58.6%±1.6%의 성공률을 달성하여 강력한 LLM이 악의적 입력에 대해 높은 취약성을 보임을 시사한다.
  • 프롬프트 누출은 최적화된 조합에서 약 23.6%±2.7%의 성공률을 달성하여 누출이 하이재킹보다 어렵지만 여전히 가능함을 나타낸다.
  • 지시를 명확하게 구분하는 구분자는 공격 성공을 크게 높이며, 일부 구분자 길이/반복이 영향력을 극대화한다.
  • 온도가 높을수록 공격 성공이 다소 감소하나 모델의 예측 불가능성을 증가시키고, 상한-확률(Top-p)/패널티의 효과는 혼합적이거나 제한적이다.
  • Text-davinci-002는 테스트된 더 작거나 OpenAI 모델보다 공격에 훨씬 취약했다.
  • 완화 방법으로는 중지 시퀀스, 출력 길이 제한, 후처리 모더레이션, 이중 매개변수 안전 제어와 같은 아키텍처적 변경 가능성을 포함한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.