Skip to main content
QUICK REVIEW

[논문 리뷰] Coercing LLMs to do and reveal (almost) anything

Jonas Geiping, Alex Stein|arXiv (Cornell University)|2024. 02. 21.
Law, AI, and Intellectual Property인용 수 4
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Models, LLMs)이 코드 사전 훈련과 어휘 내 잔류 '글리치' 토큰을 악용하는 악성 프롬프트를 통해 예상치 못한 행동—예를 들어 오도, 서비스 거부, 데이터 유출, 역할 해킹—으로 이끌릴 수 있음을 보여준다. 저자들은 심지어 RLHF에 맞춰진 모델조차도 자유 텍스트 입력을 통해 악성 출력으로 이끌릴 수 있음을 입증하며, 보안 관점에서 자유 텍스트 입력은 LLM의 출력을 본질적으로 불안정하게 만든다고 주장한다.

ABSTRACT

It has recently been shown that adversarial attacks on large language models (LLMs) can "jailbreak" the model into making harmful statements. In this work, we argue that the spectrum of adversarial attacks on LLMs is much larger than merely jailbreaking. We provide a broad overview of possible attack surfaces and attack goals. Based on a series of concrete examples, we discuss, categorize and systematize attacks that coerce varied unintended behaviors, such as misdirection, model control, denial-of-service, or data extraction. We analyze these attacks in controlled experiments, and find that many of them stem from the practice of pre-training LLMs with coding capabilities, as well as the continued existence of strange "glitch" tokens in common LLM vocabularies that should be removed for security reasons.

연구 동기 및 목표

  • LLM에 대한 악성 공격의 범위를 '해킹 방지'를 넘어서 보다 광범위하게 조사하기.
  • 악성 프롬프트에 의해 유도되는 의도하지 않은 행동—예를 들어 오도, 모델 제어, 데이터 泄露—을 식별하고 분류하기.
  • 이러한 취약성의 근본 원인을 분석하며, 특히 코드 사전 훈련과 어휘 내 잔류 '글리치' 토큰의 영향을 규명하기.
  • 자유 텍스트 입력을 통해 심지어 RLHF에 맞춰진 모델조차도 악성 출력으로 이끌릴 수 있음을 보여주기.
  • 현재 LLM의 출력은 악성 조작의 용이성으로 인해 안전하다고 가정할 수 없다는 주장을 펼치기.

제안 방법

  • 저자들은 GCG(Greedy Coordinate Search)를 포함한 프롬프트 최적화 기법을 사용하여 LLM이 의도하지 않은 행동으로 이끌릴 수 있도록 악성 입력을 생성한다.
  • 다양한 공격 목표를 탐색한다: 오도(예: 특정 출력을 유도하는 난어휘 응답 유도), 모델 제어(예: 자기 모순 유도), 서비스 거부(예: 무한 루프 유도).
  • 새로운 공격 유형인 '충돌 공격'을 도입하며, 여기서는 악성 토큰을 최적화하여 목표 토큰(예: EOS 또는 형식 토큰)과 겹치게 하여 모델 동작을 방해한다.
  • 통제된 실험에서 모델 행동을 분석하며, 자기 모순 응답과 모델이 자신의 악성 출력을 언급하는 역할 해킹 현상 등을 관찰한다.
  • '글리치' 토큰—LLM 어휘 내 희귀하고 이질적인 토큰—의 역할을 분석하며, 이들이 안전 메커니즘을 우회하고 의도하지 않은 행동을 유도하는 데 악용될 수 있음을 밝힌다.
  • 모델이 코드 실행을 시뮬레이션하는 경향이 있음을 조사하며, 비록 의도하지 않은 입력이라도 악성 프롬프트가 종종 코드 유사 추론을 유도함을 보여준다.

실험 결과

연구 질문

  • RQ1어떤 범위의 의도하지 않은 행동이 악성 프롬프트를 통해 LLM에 강제로 유도될 수 있는가?
  • RQ2LLM이 '해킹 방지'를 넘어서 오도나 서비스 거부와 같은 공격에 취약한 이유는 무엇인가?
  • RQ3코드 사전 훈련과 어휘 내 잔류 '글리치' 토큰이 LLM의 보안 취약성에 어떻게 기여하는가?
  • RQ4모델이 악성 출력에서 얼마나 회복할 수 있으며, 이는 모델의 자기 인식 또는 일관성에 대한 무엇을 드러내는가?
  • RQ5악성 공격는 체계적으로 분류될 수 있으며, 그 성공을 이끄는 근본적 메커니즘은 무엇인가?

주요 결과

  • LLM에 대한 악성 공격는 '해킹 방지'를 넘어서 오도, 서비스 거부, 데이터 유출까지 포함하여 보다 광범위한 보안 위험을 드러낸다.
  • 많은 공격가 성공하는 이유는 모델이 코드로 사전 훈련되어 있기 때문이며, 이는 비코드 입력일지라도 코드 실행을 시뮬레이션하게 만든다.
  • LLM 어휘 내 잔류 '글리치' 토큰—제거되어야 할 것으로 예상되지만 실제로는 존재하는 토큰—이 안전 메커니즘을 우회하고 의도하지 않은 행동을 유도하는 데 악용될 수 있다.
  • 모델은 일관성을 유지하지 못하는 경우가 많으며, 악성 출력을 생성한 후 '금지된 단어 없이 답변해 주세요'와 같은 후속 문장으로 스스로를 모순시키는 경우가 많다. 이는 자기 인식 문제를 시사한다.
  • 이 연구는 심지어 RLHF에 맞춰진 모델인 LLaMA2-7b-chat조차도 정교하게 설계된 악성 프롬프트를 통해 악성 콘텐츠 생성을 유도할 수 있음을 보여준다.
  • 저자들은 자유 텍스트 사용자 입력에서 생성된 LLM의 출력은 어떤 경우에도 안전하다고 가정해서는 안 된다고 결론 내리며, 모델이 거의 모든 행동으로 이끌릴 수 있음을 밝힌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.