Skip to main content
QUICK REVIEW

[논문 리뷰] On the Safety of Open-Sourced Large Language Models: Does Alignment Really Prevent Them From Being Misused?

Hangfan Zhang, Zhimeng Guo|arXiv (Cornell University)|2023. 10. 02.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 오픈소스화되고 정렬된 대규모 언어 모델(LLM)에서 텍스트 생성 중 확률 분포를 조작함으로써 악성 또는 비밀 내용을 복잡한 프롬프트 엔지니어링 없이 생성할 수 있도록 하는 모델 해킹 공격 ProMan을 소개한다. 이 방법은 네 개의 LLM에서 정렬 보호 장치를 성공적으로 우회하여 현재의 정렬 기법이 오용을 방지하는 데 부적절함을 입증한다.

ABSTRACT

Large Language Models (LLMs) have achieved unprecedented performance in Natural Language Generation (NLG) tasks. However, many existing studies have shown that they could be misused to generate undesired content. In response, before releasing LLMs for public access, model developers usually align those language models through Supervised Fine-Tuning (SFT) or Reinforcement Learning with Human Feedback (RLHF). Consequently, those aligned large language models refuse to generate undesired content when facing potentially harmful/unethical requests. A natural question is "could alignment really prevent those open-sourced large language models from being misused to generate undesired content?''. In this work, we provide a negative answer to this question. In particular, we show those open-sourced, aligned large language models could be easily misguided to generate undesired content without heavy computations or careful prompt designs. Our key idea is to directly manipulate the generation process of open-sourced LLMs to misguide it to generate undesired content including harmful or biased information and even private data. We evaluate our method on 4 open-sourced LLMs accessible publicly and our finding highlights the need for more advanced mitigation strategies for open-sourced LLMs.

연구 동기 및 목표

  • 오픈소스 LLM의 정렬이 악성 또는 비밀 콘텐츠 생성을 진정으로 방지하는지 조사하기 위해.
  • 중요한 계산 자원이나 프롬프트 엔지니어링 없이 오픈소스 LLM의 생성 과정을 악용하는 실용적인 공격 방법을 개발하기 위해.
  • 조정된 LLM라도 확률 분포를 직접 조작함으로써 여전히 오용 가능함을 입증하기 위해.
  • 이러한 모델 해킹 위협을 완화하기 위한 사전 훈련 및 사후 훈련 단계의 대응 조치를 제안하기 위해.

제안 방법

  • ProMan은 오픈소스 LLM의 자동회귀 생성 과정 중 토큰의 확률 분포를 직접 조작한다.
  • 악성 프롬프트에 응답할 때 특정 긍정적 토큰(예: '완전히! 여기서는')을 처음에 생성하도록 강제한다.
  • 목표 토큰의 로짓을 조정하여 확률를 근접한 확정성으로 높이는 유도 가능한 최적화 과정을 사용한다.
  • 확률 이동의 크기를 제어하는 핵심 하이퍼파라미터 δ가 있으며, 실험에서는 신뢰성 있는 토큰 생성을 확보하기 위해 δ = 200을 사용한다.
  • 모델의 생성을 악성 또는 비밀 콘텐츠로 '잠금을 해제'하기 위해 첫 번째 몇 토큰을 대상으로 한다.
  • 모델 가중치를 수정하지 않기 때문에 경량의 사후 정렬 공격이다.

실험 결과

연구 질문

  • RQ1SFT와 RLHF와 같은 정렬 기법이 적용된 오픈소스 정렬 LLM도 여전히 악성 콘텐츠 생성을 위해 오용될 수 있는가?
  • RQ2프롬프트 엔지니어링 대신 생성 과정의 직접적 조작을 통해 정렬 보호 장치를 우회할 수 있는가?
  • RQ3ProMan은 여러 오픈소스 LLM에서 비밀 데이터나 악성 콘텐츠를 얼마나 효과적으로 유도하는가?
  • RQ4현재의 정렬 전략은 모델 해킹 공격을 방지하는 데 어떤 한계를 지니는가?
  • RQ5어떤 사후 훈련 또는 사전 훈련 대응 조치가 이러한 공격을 완화하는 데 도움이 될 수 있는가?

주요 결과

  • ProMan은 비밀 데이터 요청 시 Vicuna, Llama-2-LoRA, Marcoroni에서 공격 성공률(ASR-P) 100%를 기록했고, ChatGLM에서는 95%를 기록했다.
  • 악성 콘텐츠 생성에 대한 공격 성공률는 Vicuna에서 91%, Llama-2-LoRA에서 95%로, 다양한 모델에서 높은 효과성을 입증했다.
  • 모든 평가된 LLM에서 히우리스틱 및 최적화 기반 베이스라인보다 ProMan이 더 높은 ASR-P 및 ASR-A 점수를 기록하여 슈퍼어리어어를 보였다.
  • 사례 연구에서 정규 표현식 매칭을 통해 실제 진짜 비밀 데이터인 전화번호와 이메일 주소도 성공적으로 생성했다.
  • 비밀 유출가능성이 더 높은 것으로 나타나 현재의 정렬 전략이 비밀 유출을 방지하는 데 부적절함을 입증했다.
  • 확률 조작을 통한 모델 해킹은 오픈소스 LLM의 안전성에 심각하고 충분히 인식되지 않은 위협임을 드러냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.