Skip to main content
QUICK REVIEW

[논문 리뷰] Tensor Trust: Interpretable Prompt Injection Attacks from an Online Game

Sam Toyer, Olivia Watkins|arXiv (Cornell University)|2023. 11. 02.
Adversarial Robustness in Machine Learning인용 수 5
한 줄 요약

이 논문은 지능형 지시 따르기 LLM에 대한 프롬프트 인젝션 공격과 방어를 126,000건 이상, 46,000건 이상 생성하는 온라인 게임인 Tensor Trust를 소개한다. GPT-3.5 Turbo를 백엔드로 사용하여, 해석 가능한 공격 패tern을 드러내고 프롬프트 탈취 및 프롬프트 가로채기에 대한 LLM의 강건성을 평가하며, 많은 모델이 게임 설정에서 일반화된 전략으로도 여전히 취약함을 보여준다.

ABSTRACT

While Large Language Models (LLMs) are increasingly being used in real-world applications, they remain vulnerable to prompt injection attacks: malicious third party prompts that subvert the intent of the system designer. To help researchers study this problem, we present a dataset of over 126,000 prompt injection attacks and 46,000 prompt-based "defenses" against prompt injection, all created by players of an online game called Tensor Trust. To the best of our knowledge, this is currently the largest dataset of human-generated adversarial examples for instruction-following LLMs. The attacks in our dataset have a lot of easily interpretable stucture, and shed light on the weaknesses of LLMs. We also use the dataset to create a benchmark for resistance to two types of prompt injection, which we refer to as prompt extraction and prompt hijacking. Our benchmark results show that many models are vulnerable to the attack strategies in the Tensor Trust dataset. Furthermore, we show that some attack strategies from the dataset generalize to deployed LLM-based applications, even though they have a very different set of constraints to the game. We release all data and source code at https://tensortrust.ai/paper

연구 동기 및 목표

  • 지시 튜닝된 LLM에서 실제 세계의 프롬프트 인젝션 취약점을 인간이 생성한 대비 예제를 통해 연구하기 위해.
  • 실제 인간 전략을 반영한 확장 가능하고 해석 가능한 공격 및 방어 데이터셋을 구축하기 위해.
  • 프롬프트 탈취 및 프롬프트 가로채기와 같은 두 가지 주요 공격 유형에 대한 LLM의 강건성 평가하기 위해.
  • 게임에서 유도된 공격 전략이 실제 세계의 LLM 응용 프로그램으로 일반화됨을 입증하기 위해.
  • 미래의 LLM 보안 연구를 위한 재현 가능한 벤치마크와 오픈소스 데이터셋 제공하기 위해.

제안 방법

  • Tensor Trust 웹 게임은 플레이어가 비밀 코드를 입력했을 때만 '접근 허용' 메시지가 출력되는 보안 접근 시스템을 시뮬레이션한다.
  • 공격자는 코드나 방어 전략을 모른 채 LLM이 '접근 허용'을 출력하도록 프롬프트를 구성해야 하며, 이는 실제 세계의 프롬프트 인젝션을 시뮬레이션한다.
  • 모든 공격 및 방어는 실시간 플레이어 게임 플레이에서 수집되었으며, 플레이어 ID와 타임스탬프를 포함해 총 126,808건의 공격과 46,457건의 방어로 구성된 데이터셋을 생성했다.
  • 저자들은 두 가지 벤치마크를 설계했다: 하나는 방어 프롬프트를 재구성하는 프롬프트 탈취용이며, 다른 하나는 코드 없이 접근을 확보하는 프롬프트 가로채기용이다.
  • 실험을 통해 GPT-3.5 Turbo의 강건성이 다섯 가지 메시지 역할 구성에서 평가되었으며, 성능에 미미한 변동만을 보였다.
  • 데이터셋에서 유도된 공격 전략을 실제 LLM 기반 응용 프로그램에 적용하여, 설정 간 일반화가 가능함을 입증했다.
Figure 1: In Tensor Trust, each player creates a defense (blue) that causes an LLM (yellow) to say “access granted” when a secret access code (green) is entered. Attackers are not shown the defense or access code and must instead gain access with prompt injection attacks (red) .
Figure 1: In Tensor Trust, each player creates a defense (blue) that causes an LLM (yellow) to say “access granted” when a secret access code (green) is entered. Attackers are not shown the defense or access code and must instead gain access with prompt injection attacks (red) .

실험 결과

연구 질문

  • RQ1실제 세계의 게임 환경에서 어떤 해석 가능한 인간 생성 프롬프트 인젝션 전략이 등장하는가?
  • RQ2다양하고 인간이 만든 공격에 노출되었을 때 지시 튜닝된 LLM은 프롬프트 인젝션에 얼마나 강건한가?
  • RQ3게임에서 유도된 공격 전략은 다른 제약 조건을 가진 실제 세계의 LLM 응용 프로그램으로 얼마나 일반화되는가?
  • RQ4역할 할당(시스템/사용자)이 LLM의 프롬프트 인젝션에 대한 취약성에 어떤 영향을 미치는가?
  • RQ5게임 기반 데이터 수집 방식이 대규모 고품질의 LLM 보안 평가를 위한 벤치마크를 제공할 수 있는가?

주요 결과

  • Tensor Trust 데이터셋은 지시 따르기 LLM을 대상으로 한 가장 큰 알려진 인간 생성 데이터셋으로, 126,808건의 고유한 프롬프트 인젝션 공격과 46,457건의 방어를 포함한다.
  • GPT-3.5 Turbo는 모든 메시지 역할 구성에서 프롬프트 가로채기 강건성 비율(HRR)이 19%에서 31% 사이로 나타나, 일관된 취약성을 보였다.
  • 프롬프트 탈취 강건성 비율(ERR)은 27%에서 35% 사이로 변동하여, 많은 모델이 내부 프롬프트 논리 구조를 보호하지 못함을 보여주었다.
  • 게임은 LLM이 종종 '사용자' 지시를 '시스템' 지시보다 우선시하는 경향이 있음을 드러내어 심각한 설계 결함을 폭 드러냈다.
  • 게임에서 유도된 몇 가지 공격 전략이 다른 제약 조건이 있는 실제 LLM 기반 응용 프로그램에서도 성공적으로 우회함을 입증했다.
  • 이 데이터셋은 희귀 토큰에서의 이상 행동과 역할 혼동과 같은 LLM 실패 모드의 해석 가능한 분석을 가능하게 한다.
Tensor Trust: Interpretable Prompt Injection Attacks from an Online Game

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.