[논문 리뷰] Ignore This Title and HackAPrompt: Exposing Systemic Vulnerabilities of LLMs through a Global Scale Prompt Hacking Competition
이 논문은 인간이 생성한 악성 프롬프트를 통해 대규모 글로벌 프롬프트 해킹 경쟁인 HackAPrompt를 도입하여, 대규모 언어 모델(Large Language Models, LLMs)의 체계적 취약성을 체계적으로 폭 드러내는 것을 목적으로 한다. GPT-3.5-turbo를 포함한 세 종류의 최신 LLM을 대상으로 60만 개 이상의 프롬프트를 수집함으로써, 프롬프트 해킹의 실현 가능성을 실증적으로 검증하고, 공격 패턴에 대한 포괄적인 분류 체계를 수립하여 실제 LLM 배포 환경에서의 심각한 보안 위험을 드러낸다.
Large Language Models (LLMs) are deployed in interactive contexts with direct user engagement, such as chatbots and writing assistants. These deployments are vulnerable to prompt injection and jailbreaking (collectively, prompt hacking), in which models are manipulated to ignore their original instructions and follow potentially malicious ones. Although widely acknowledged as a significant security threat, there is a dearth of large-scale resources and quantitative studies on prompt hacking. To address this lacuna, we launch a global prompt hacking competition, which allows for free-form human input attacks. We elicit 600K+ adversarial prompts against three state-of-the-art LLMs. We describe the dataset, which empirically verifies that current LLMs can indeed be manipulated via prompt hacking. We also present a comprehensive taxonomical ontology of the types of adversarial prompts.
연구 동기 및 목표
- LLM의 프롬프트 해킹에 관한 대규모이고 정량적인 연구가 부족한 데 대비하기 위해.
- 생산 환경에 유사한 LLM 배포 환경에서 자유형 인간 입력 공격을 통해 실제 세계의 공격 시나리오를 시뮬레이션하기 위해.
- 프롬프트 삽입 공격의 유형과 성공률를 이해하기 위해 악성 프롬프트의 거대한 데이터셋을 수집하고 분석하기 위해.
- 모델의 강건성과 방어 전략을 향상시키기 위해 프롬프트 해킹 기법의 체계적 분류 체계를 수립하기 위해.
- 향후 LLM 보안 및 정렬 연구를 지원하기 위해 HuggingFace에 공개 가능한 데이터셋을 제공하기 위해.
제안 방법
- 2,800명 이상의 참가자로부터 악성 프롬프트를 유도하기 위해 글로벌이고 보상 인cent라이즈된 프롬프트 해킹 경쟁을 조직하였다.
- GPT-3.5-turbo를 포함한 세 종류의 최신 LLM을 대상으로 60만 개 이상의 악성 프롬프트를 수집하였다.
- 다중 수준의 구조화된 경쟁을 설계하였으며, 토큰 제한 조작이 필요한 복잡한 '매드 샌드위치 방어' 레벨을 포함하였다.
- 문자 대체, 중국어로 번역, 토큰 수 계산 등의 기법을 사용하여 제약 조건을 우회하기 위해 프롬프트 생성 및 최적화를 자동화하였다.
- 공격 의도를 유지하면서 토큰 한도에 사용자 입력을 동적으로 채우는 알고리즘 1 기반의 의사코드 기반 자동화 파이프라인을 개발하였다.
- 관찰된 공격 패턴과 전략에 기반하여 악성 프롬프트 유형의 포괄적인 분류 체계를 수립하였다.

실험 결과
연구 질문
- RQ1최신 LLM을 조작하는 데 가장 효과적인 악성 프롬프트의 유형은 무엇인가?
- RQ2실제 상호작용 기반의 LLM 배포 환경에서 프롬프트 삽입 공격는 얼마나 퍼져 있으며, 확장 가능한가?
- RQ3인간이 생성한 프롬프트 해킹 시도에서 어떤 체계적 패턴과 전략이 드러나는가?
- RQ4자동화는 효과적인 프롬프트 공격의 발견과 정교화에 얼마나 기여하는가?
- RQ5대규모이고 인간이 수작업으로 정리한 악성 프롬프트 데이터셋은 LLM 보안 평가 및 방어에 어떻게 기여할 수 있는가?
주요 결과
- 2,800명 이상의 참가자로부터 60만 개 이상의 악성 프롬프트가 성공적으로 수집되어 프롬프트 해킹의 광범위한 실현 가능성을 입증하였다.
- 연구는 현재의 LLM이 복잡한 프롬프트 템플릿으로 보호되어 있더라도 프롬프트 삽입 공격에 매우 취약하다는 것을 실증적으로 확인하였다.
- 다양한 공격 전략이 식별되었으며, 프롬프트에 따라 '따르기' 전략, 코드 삽입, 괄호/따옴표 조작, 위장 입력 등이 포함되었다.
- 자동화는 특히 토큰 제약 조건이 있는 환경(예: 레벨 9)에서 공격 효율을 크게 향상시켰으며, 동적 입력 채우기와 문자 대체 기법이 성공률을 높였다.
- 프롬프트 일부를 중국어로 번역하는 것이 일부 LLM의 오해를 우회하는 데 도움이 되어, 모델의 행동이 입력 인코딩 및 언어 맥락에 민감함을 시사하였다.
- 수집된 데이터셋은 특정 모델 완성에 정확히 대응하는 사용자 입력의 가장 큰 알려진 컬렉션 중 하나이며, 더 안전한 LLM을 위한 새로운 학습 및 평가 기회를 제공한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.