Skip to main content
QUICK REVIEW

[논문 리뷰] Exploiting Programmatic Behavior of LLMs: Dual-Use Through Standard Security Attacks

Daniel Kang, Xuechen Li|arXiv (Cornell University)|2023. 02. 11.
Topic Modeling인용 수 27
한 줄 요약

요약: 이 논문은 지시 따름 LLM이 표준 보안 공격(난독화, 코드 주입/페이로드 분할, 가상화)을 사용해 콘텐츠 필터를 우회하고 저비용으로 높을 신뢰성을 갖춘 대상 악성 콘텐츠를 생성할 수 있음을 보여준다.

ABSTRACT

Recent advances in instruction-following large language models (LLMs) have led to dramatic improvements in a range of NLP tasks. Unfortunately, we find that the same improved capabilities amplify the dual-use risks for malicious purposes of these models. Dual-use is difficult to prevent as instruction-following capabilities now enable standard attacks from computer security. The capabilities of these instruction-following LLMs provide strong economic incentives for dual-use by malicious actors. In particular, we show that instruction-following LLMs can produce targeted malicious content, including hate speech and scams, bypassing in-the-wild defenses implemented by LLM API vendors. Our analysis shows that this content can be generated economically and at cost likely lower than with human effort alone. Together, our findings suggest that LLMs will increasingly attract more sophisticated adversaries and attacks, and addressing these attacks may require new approaches to mitigations.

연구 동기 및 목표

  • 지시 따름 LLM의 이중 사용 위험성을 동기 부여하고 정량화한다.
  • LLM이 보안 공격용 ‘도구’ 를 반환하는 프로그래밍 가능한 시스템처럼 동작한다는 것을 보여준다.
  • 현실에서의 방어를 우회하는 공격을 시연하고 악성 생성의 경제적 타당성을 평가한다.
  • 전통적인 컴퓨터 보안에서의 교훈을 바탕으로 새로운 방어책을 주장한다.

제안 방법

  • 메모리, 할당, 분기 등의 opcodes를 가진 프로그래밍 가능한 시스템으로 LLM을 모델링한다.
  • 프롬프트에서 고전적 보안에서 차용한 난독화, 코드 주입/페이로드 분할, 가상화 공격을 설계한다.
  • 다양한 악성 사용 시나리오에서 OpenAI 방어(입출력 필터, 무의미한 생성)에 대한 공격을 평가한다.
  • 모델 간 생성 설득력과 우회 성공률을 비교 정량화한다.
  • 모델 생성 콘텐츠와 인간 생성 콘텐츠 간 비용 차이를 경제적으로 분석한다.
  • 악성 생성의 개인화와 설득력에 대한 분석을 수행한다.

실험 결과

연구 질문

  • RQ1지시 따름 LLM이 간단한 공격으로도 실제 환경의 방어(입출력 필터, 무의미한 생성)를 우회할 수 있는가?
  • RQ2모델이 생성한 악성 콘텐츠가 설득력이 있고 맥락 의존적이며 개인화된 사기를 포함하는가?
  • RQ3LLM으로 악성 텍스트 생성을 인간의 노력과 비교했을 때 경제적 타당성은 어떠한가?
  • RQ4다양한 지시 따름 LLM 간에 악성 콘텐츠의 설득력, 일관성, 개인화, 유창성 측면에서 차이가 있는가?
  • RQ5전통적인 컴퓨터 보안의 방어책이나 유사점은 이러한 이중 사용 위험을 완화할 수 있는가?

주요 결과

  • 난독화와 가상화 공격이 테스트된 모든 시나리오에서 OpenAI 방어를 100% 우회했다.
  • 초기 방어가 트리거되지 않았을 때 간접화(indirection)가 전체적으로 92%의 우회율을 달성했다.
  • ChatGPT와 text-davinci-003가 테스트된 모델들 가운데 가장 설득력 있고 일관된 악성 콘텐츠를 생성했다.
  • 특히 더 높은 능력의 모델에서 악성 콘텐츠를 인구통계학적 프로필에 맞춰 개인화하고 설득력과 유창성을 크게 높일 수 있었다.
  • 경제 분석에 따르면 모델이 생성하는 악성 콘텐츠의 비용은 개발당 약 $0.0064 ~ $0.016으로 인간이 생성하는 텍스트보다 더 저렴할 수 있다.
  • 템플릿화를 통해 공격을 쉽게 확장할 수 있으며 더 높은 효과를 위해 결합될 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.