Skip to main content
QUICK REVIEW

[논문 리뷰] Composite Backdoor Attacks Against Large Language Models

Hai Huang, Zhengyu Zhao|arXiv (Cornell University)|2023. 10. 11.
Adversarial Robustness in Machine Learning인용 수 4
한 줄 요약

이 논문은 대규모 언어 모델을 대상으로 하는 새로운 도청 공격 기법인 복합 도청 공격(CBA)을 제안한다. CBA는 지시어 및 입력과 같은 다양한 프롬프트 구성 요소에 다수의 트리거 키를 산산이 흩어뜨려, 모든 트리거가 동시에 나타나야만 작동하도록 설계되어 있어 도청 공격의 정교함을 높였다. LLaMA-7B에서 3%의 오염 데이터만으로도 CBA는 100%의 공격 성공률를 기록했으며, 거짓 작동률는 2.06% 미만, 정확도 저하도 극미량에 그쳐 높은 효과성과 정교한 타겟팅 능력을 입증하였다.

ABSTRACT

Large language models (LLMs) have demonstrated superior performance compared to previous methods on various tasks, and often serve as the foundation models for many researches and services. However, the untrustworthy third-party LLMs may covertly introduce vulnerabilities for downstream tasks. In this paper, we explore the vulnerability of LLMs through the lens of backdoor attacks. Different from existing backdoor attacks against LLMs, ours scatters multiple trigger keys in different prompt components. Such a Composite Backdoor Attack (CBA) is shown to be stealthier than implanting the same multiple trigger keys in only a single component. CBA ensures that the backdoor is activated only when all trigger keys appear. Our experiments demonstrate that CBA is effective in both natural language processing (NLP) and multimodal tasks. For instance, with $3\%$ poisoning samples against the LLaMA-7B model on the Emotion dataset, our attack achieves a $100\%$ Attack Success Rate (ASR) with a False Triggered Rate (FTR) below $2.06\%$ and negligible model accuracy degradation. Our work highlights the necessity of increased security research on the trustworthiness of foundation LLMs.

연구 동기 및 목표

  • 대규모 언어 모델(LLM)이 다양한 프롬프트 구성 요소를 악용하는 도청 공격에 취약한지 조사하기.
  • 트리거 키를 다양한 프롬프트 구성 요소에 분산시켜 거짓 양성률를 낮추고 더 정교한 도청 공격 전략을 개발하기.
  • 실제 오염 조건 하에서 자연어 처리(NLP) 및 다중모odal 작업에 대한 이러한 공격의 효과성을 평가하기.
  • 암시적 또는 명시적 트리거 설정을 통해 특정 사용자 집단을 정밀하게 타겟팅할 수 있는지 탐색하기.
  • 기초 LLM의 신뢰성과 방어 메커니즘 향상의 긴급한 필요성을 부각하기.

제안 방법

  • 공격은 '지시어' 및 '입력'과 같은 서로 다른 프롬프트 구성 요소에 다수의 트리거 키를 집중시키는 대신 산재하게 분산시킨다.
  • 모든 필수 트리거 키가 각각의 구성 요소에 동시에 나타나야만 도청이 활성화되어 도청의 정교함이 향상된다.
  • 이중 구성 요소 오염 전략을 사용한다: 모든 트리거가 포함된 '양성' 샘플과 일부 트리거만 포함된 '음성' 샘플을 생성하여, 모델이 전체 트리거 세트를 도청 출력과 연관짓도록 훈련시킨다.
  • 트리거 키는 의미적 혼란을 피하고 퍼플렉서티 기반 방법에 의해 탐지되는 것을 피하기 위해 일반적인 단어나 어구로 선택된다.
  • 이 방법은 자연어 처리(NLP) 작업(예: 정서 분류)과 다중모달 작업(예: LLaVA)에 모두 적용되며, Alpaca와 같은 표준 프롬프트 템플릿을 사용한다.
  • 오염 비율과 트리거 설정에 따라 평가되며, 트리거 배치와 모델 아키텍처에 대한 분석 실험도 수행된다.
Figure 1 : Illustration of our attack in both NLP tasks (left) and multimodal tasks (right). A text trigger is a word (marked in red) and an image trigger is a red patch at the center of the image.
Figure 1 : Illustration of our attack in both NLP tasks (left) and multimodal tasks (right). A text trigger is a word (marked in red) and an image trigger is a red patch at the center of the image.

실험 결과

연구 질문

  • RQ1다양한 프롬프트 구성 요소에 다수의 트리거 키를 분산시킴으로써 LLM에 대한 도청 공격의 정교함과 효과성을 향상시킬 수 있는가?
  • RQ2전통적인 단일 구성 요소 도청 공격에 비해 복합 도청 공격(CBA)은 공격 성공률, 거짓 작동률, 모델 유틸리티 저하 측면에서 어떻게 비교되는가?
  • RQ3CBA는 암시적 또는 언어 특화 트리거를 사용하여 특정 사용자 집단을 얼마나 정밀하게 타겟팅할 수 있는가?
  • RQ4일반어휘로 구성된 트리거를 신중히 선택한 CBA에 대해 기존의 퍼플렉서티 기반 탐지 기법은 얼마나 효과적인가?
  • RQ5CBA는 두 개 이상의 구성 요소를 가진 프롬프트로 확장될 수 있으며, 복잡성과 탐지 위험 사이의 상충 관계는 어떠한가?

주요 결과

  • 감정 데이터셋에서 LLaMA-7B 모델에 3%의 오염 데이터를 적용한 결과, CBA는 100%의 공격 성공률를 기록했으며, 거짓 작동률는 2.06% 이하였다.
  • 도청된 모델의 정제된 테스트 정확도는 정상 모델보다 1.06% 높아, 성능 저하가 극미량임을 시사했다.
  • 퍼플렉서티 기반 탐지 방법은 '지시어' 트리거 키의 100%를 탐지하지 못했고, '입력' 트리거 키의 경우 오직 12.10%만 탐지할 수 있었다. 이는 CBA에 대한 효과가 제한적임을 보여준다.
  • 트리거가 일반적인 단어로 구성되어 있어도 공격는 효과를 유지했으며, 이는 의미적 또는 빈도 기반 분석으로서의 탐지가 더 어려워졌음을 의미한다.
  • CBA는 자연어 처리 및 다중모달 작업 전반에서 뛰어난 성능을 보였으며, LLaVA-13B 모델에서도 일관된 높은 성공률와 낮은 거짓 양성률을 기록했다.
  • 지시어 구성 요소에 작업 관련 또는 시스템 전용 트리거(예: 'Siri' 또는 특정 언어)를 사용함으로써 특정 사용자 집단을 정교하게 타겟팅할 수 있다.
Figure 2 : Impact of the “positive” poisoning ratio on the attack performance on three NLP datasets.
Figure 2 : Impact of the “positive” poisoning ratio on the attack performance on three NLP datasets.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.