[논문 리뷰] Assessing Prompt Injection Risks in 200+ Custom GPTs
이 연구는 OpenAI 플랫폼에 배포된 200개 이상의 사용자 생성 커스터마이징 GPT에서 프롬프트 인젝션 취약성을 조사하며, 악성 프롬프트가 높은 성공률로 시스템 프롬프트와 업로드된 파일을 추출할 수 있음을 입증한다. 연구 결과, 방어 프롬프트와 코드 인터프리터 비활성화와 같은 기존의 방어 조치가 정교한 공격에 대해 충분하지 않음을 확인하였으며, 커스터마이징 가능한 LLM에서 더 강력한 보안 프레임워크가 시급히 필요하다는 점을 시사한다.
In the rapidly evolving landscape of artificial intelligence, ChatGPT has been widely used in various applications. The new feature - customization of ChatGPT models by users to cater to specific needs has opened new frontiers in AI utility. However, this study reveals a significant security vulnerability inherent in these user-customized GPTs: prompt injection attacks. Through comprehensive testing of over 200 user-designed GPT models via adversarial prompts, we demonstrate that these systems are susceptible to prompt injections. Through prompt injection, an adversary can not only extract the customized system prompts but also access the uploaded files. This paper provides a first-hand analysis of the prompt injection, alongside the evaluation of the possible mitigation of such attacks. Our findings underscore the urgent need for robust security frameworks in the design and deployment of customizable GPT models. The intent of this paper is to raise awareness and prompt action in the AI community, ensuring that the benefits of GPT customization do not come at the cost of compromised security and privacy.
연구 동기 및 목표
- 사용자 맞춤형 GPT 모델이 OpenAI 플랫폼에 배포된 상태에서 프롬프트 인젝션의 보안 위험을 조사하는 것.
- 실제 커스터마이징 GPT에서 악성 프롬프트를 통해 시스템 프롬프트와 업로드된 파일을 추출할 수 있는지의 가능성을 평가하는 것.
- 방어 프롬프트와 코드 인터프리터 비활성화와 같은 기존 방어 메커니즘이 정교한 레드팀 공격에 대해 얼마나 효과적인지 평가하는 것.
- 커스터마이징 가능한 LLM에서 프롬프트 인젝션을 통한 데이터 泄露 및 지적 재산권 도용 위험에 대해 AI 커뮤니티의 경각심을 고취시키는 것.
- 현재의 히وري스틱 기반 방어 조치를 뛰어넘어 장기적인 보안 솔루션의 개발을 촉진하는 것.
제안 방법
- 연구진은 OpenAI GPT 스토어에서 이용 가능한 200개 이상의 커스터마이징 GPT를 대상으로 악성 프롬프트를 설계하고 배포하였다.
- 두 단계로 구성된 레드팀 공격 전략을 사용: 먼저 파일 이름과 코드 인터프리터 존재 여부를 스캔한 후, 타겟팅된 프롬프트 인젝션 공격을 수행하였다.
- 다양한 프롬프트 전략을 사용한 네 명의 전문 레드팀원이 참여한 레드팀 평가를 실시하여 시스템 프롬프트 추출 및 파일 泄露를 테스트하였다.
- 코드 인터프리터 비활성화가 공격 성공률에 미치는 영향을 평가하기 위해, 이 기능이 있는 GPT와 없는 GPT 간 결과를 비교하였다.
- 공개 이전에 OpenAI에 책임감 있는 유출을 통보하고 실험 후 모든 추출 데이터를 삭제하는 조치를 취하였다.
- 모든 데이터셋, 공격 프롬프트, 레드팀 평가 결과를 오픈소스로 공개하여 재현 가능성과 향후 연구를 가능하게 하였다.

실험 결과
연구 질문
- RQ1악성 프롬프트는 사용자 맞춤형 GPT에서 얼마나 정확하게 시스템 프롬프트를 추출할 수 있는가?
- RQ2공격자는 프롬프트 인젝션을 통해 업로드된 파일의 이름과 크기를 신뢰성 있게 복구할 수 있는가?
- RQ3방어 프롬프트는 커스터마이징 GPT에서 시스템 프롬프트 추출 및 파일 泄露를 얼마나 효과적으로 완화하는가?
- RQ4코드 인터프리터 비활성화는 프롬프트 인젝션 공격의 성공률을 상당히 감소시키는가?
- RQ5정교한 악성 프롬프트는 실세계 공격 상황에서 최신 보안 메커니즘을 우회할 수 있는가?
주요 결과
- 200개 이상의 커스터마이징 GPT를 테스트한 결과, 대부분의 모델이 악성 프롬프트를 통해 시스템 프롬프트 추출에 취약함을 확인하였다.
- 코드 인터프리터가 존재할 경우 공격 성공률이 상승하고, 프롬프트 인젝션 공격에 필요한 시도 횟수가 감소하였다.
- 방어 프롬프트를 사용한 경우에도 숙련된 공격자가 이를 우회할 수 있었으며, 이는 이러한 방어 조치가 결심된 공격자에게는 부적절하다는 것을 시사한다.
- 코드 인터프리터 비활성화는 보안을 향상시켰지만, 위험을 완전히 제거하지 못했으며, 네 명의 전문가 중 네 명 중 세 명이 10회 이내의 시도로도 시스템 프롬프트를 추출하는 데 성공하였다.
- 업로드된 파일, 특히 파일 이름과 크기 정보가 프롬프트 인젝션을 통해 체계적으로 탐지되고 유출될 수 있음을 확인하였다.
- 연구진은 DALL·E GPT에서 시스템 프롬프트와 파일 메타데이터를 성공적으로 추출하여, 이러한 취약성이 실세계 모델에서도 악용 가능하다는 점을 입증하였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.