[논문 리뷰] LoFT: Local Proxy Fine-tuning For Improving Transferability Of Adversarial Attacks Against Large Language Model
이 논문은 유해한 프롬프트와 유사한 쿼리에서 국소적으로 유사한 프록시 모델을 파생시켜 대량 언어 모델에 대한 적대적 공격의 이식 가능성을 향상시키는 Local Fine-Tuning (LoFT) 방법을 제안한다. 특히, 해로운 프롬프트 주변에서 프록시 모델과 타겟 모델 간의 응답 차이를 최소화함으로써, ChatGPT, GPT-4, Claude에 각각 39%, 7%, 0.5%의 공격 성공률 향상을 달성한다.
It has been shown that Large Language Model (LLM) alignments can be circumvented by appending specially crafted attack suffixes with harmful queries to elicit harmful responses. To conduct attacks against private target models whose characterization is unknown, public models can be used as proxies to fashion the attack, with successful attacks being transferred from public proxies to private target models. The success rate of attack depends on how closely the proxy model approximates the private model. We hypothesize that for attacks to be transferrable, it is sufficient if the proxy can approximate the target model in the neighborhood of the harmful query. Therefore, in this paper, we propose \emph{Local Fine-Tuning (LoFT)}, extit{i.e.}, fine-tuning proxy models on similar queries that lie in the lexico-semantic neighborhood of harmful queries to decrease the divergence between the proxy and target models. First, we demonstrate three approaches to prompt private target models to obtain similar queries given harmful queries. Next, we obtain data for local fine-tuning by eliciting responses from target models for the generated similar queries. Then, we optimize attack suffixes to generate attack prompts and evaluate the impact of our local fine-tuning on the attack's success rate. Experiments show that local fine-tuning of proxy models improves attack transferability and increases attack success rate by $39\%$, $7\%$, and $0.5\%$ (absolute) on target models ChatGPT, GPT-4, and Claude respectively.
연구 동기 및 목표
- 공개 프록시 모델에서 비공개, 블랙박스 타겟 LLM에 대한 적대적 공격을 이식하는 데 도전하는 문제를 해결하기 위해.
- 전체 모델 정렬이 아니라 해로운 프롬프트 주변에서 타겟 모델을 국소적으로 근사하는 것이 효과적인 공격 이식에 충분한지 조사하기 위해.
- 광범위한 타겟 모델 데이터에 대한 대규모 프록시 모델 미세조정이 필요 없이도 공격 성공률를 향상시키기 위해.
- 블랙박스 공격 시나리오에서 LLM 정렬 메커니즘의 강건성 평가를 위한 실용적이고 효율적인 방법을 개발하기 위해.
제안 방법
- 프롬프트 엔지니어링 또는 쿼리의 다의어화를 통해 타겟 LLM을 사용해 각 해로운 프롬프트 주변의 의미적으로 유사한 쿼리를 생성한다.
- 이 유사 쿼리에 대한 응답을 타겟 LLM으로부터 수집하여 국소 미세조정 데이터셋을 구성한다.
- 이러한 국소 데이터에 대해 프록시 LLM의 일부 파라미터(예: 어댑터 레이어 또는 LoRA 헤드)를 미세조정하여 타겟 모델과의 응답 차이를 최소화한다.
- 기울기 기반 방법(예: GCG)을 사용해 미세조정된 프록시 모델에서 적대적 공격 접미사를 최적화하여 공격 성공률를 극대화한다.
- 자동 평가(응답 거부율)와 인간 평가를 통해 비공개 타겟 모델에서 공격 성공률를 평가한다.
- 국소 유사성 가설을 활용한다: 만약 프록시 모델과 타겟 모델이 해로운 프롬프트 주변에서 유사하게 행동한다면, 기울기 기반 공격은 더 효과적으로 이식될 것이다.

실험 결과
연구 질문
- RQ1의미적으로 유사한 쿼리에 대해 프록시 모델을 국소적으로 미세조정하는 것이 비공개 타겟 LLM에 대한 적대적 공격의 이식 가능성을 향상시키는가?
- RQ2높은 공격 성공률를 달성하기 위해 전체 모델 미세조정이 필수적인가, 아니면 국소 근사만으로도 충분한가?
- RQ3다양한 타겟 모델에서 기준 프록시 기반 공격 방법과 비교해 볼 때 LoFT는 공격 성공률 측면에서 어떤가?
- RQ4해로운 프롬프트 주변에서 LoFT는 프록시 모델과 타겟 모델 간의 응답 차이를 어느 정도 감소시키는가?
- RQ5LoFT는 자동 평가와 인간 평가 모두에서 공격 성공률에 어떤 영향을 미치는가?
주요 결과
- LoFT는 기준 프록시 모델 대비 ChatGPT에서 자동 공격 성공률를 39%포인트 향상시켰다.
- GPT-4에서는 7%포인트의 공격 성공률 향상을 기록하여 다양한 LLM 아키텍처에서 일관된 성과를 보였다.
- Claude-2에서는 0.5%포인트의 절대적 공격 성공률 향상을 달성하여 매우 정렬된 모델에서도 효과적임을 입증했다.
- 인간 평가를 통해 LoFT가 생성한 공격가 기존 방법보다 더 효과적으로 해로운 응답을 이끌어내는 것으로 확인되었다.
- GPT-4에서는 LoFT로 미세조정된 프록시를 사용할 경우 공격 성공률가 89.7%에 도달했으며, 표준 기준 대비 뚜렷한 승리를 거두었다.
- 결과적으로, 해로운 프롬프트 주변에서 타겟 모델의 행동을 국소적으로 근사하는 것이 높은 이식 가능성을 확보하는 데 충분함을 검증했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.