[논문 리뷰] Model Leeching: An Extraction Attack Targeting LLMs
이 논문은 대규모 언어 모델(Large Language Models, LLMs)인 ChatGPT-3.5-Turbo와 같은 LLM에서 작업에 특화된 지식을 더 작은, 정제된 모델로 정제하는 비용 효율적인 블랙박스 추출 공격인 Model Leeching을 소개한다. 이 공격는 자동화된 프롬프트 엔지니어링을 통해 수행되며, API 비용이 50달러에 불과한 상황에서 SQuAD에서 정확도 73%의 정확일치(Exact Match)와 F1 점수 87%를 기록한다. 또한, 공격의 전이 가능성(transferability)을 극복하여 원본 LLM을 대상으로 하는 공격 성공률을 11% 향상시킨다.
Model Leeching is a novel extraction attack targeting Large Language Models (LLMs), capable of distilling task-specific knowledge from a target LLM into a reduced parameter model. We demonstrate the effectiveness of our attack by extracting task capability from ChatGPT-3.5-Turbo, achieving 73% Exact Match (EM) similarity, and SQuAD EM and F1 accuracy scores of 75% and 87%, respectively for only $50 in API cost. We further demonstrate the feasibility of adversarial attack transferability from an extracted model extracted via Model Leeching to perform ML attack staging against a target LLM, resulting in an 11% increase to attack success rate when applied to ChatGPT-3.5-Turbo.
연구 동기 및 목표
- 생산용 LLM에 API 접근을 통해 스케일링 가능하고 저비용으로 작업에 특화된 지식을 추출하는 방법을 개발하기 위해.
- LLM에서 파생된 정제된 모델이 원본 대상 모델에 효과적인 악성 공격을 조작하는 데 사용될 수 있는지 조사하기 위해.
- 실제 LLM 위협 시나리오에서의 모델 추출 및 공격 전이 가능성의 실현 가능성과 효과성을 평가하기 위해.
- LLM 보안, 프라이버시 및 지적 재산 보호에 대한 모델 도용의 영향을 탐색하기 위해.
제안 방법
- 세 단계의 프롬프트 생성 시스템 설계: (1) 대상 LLM의 동작을 평가하기 위한 지식 탐색, (2) 관찰된 응답 패턴에 기반한 프롬프트 템플릿 구축, (3) 프롬프트의 신뢰성과 일관성 검증.
- 사전에 설계된 프롬프트를 사용해 대상 LLM의 공개 API를 통해 자동으로 고품질의 작업에 특화된 학습 데이터를 생성하기 위해.
- 추출된 데이터를 기반으로 더 작은 정제된 모델(RoBERTa-Large 등)을 훈련시어 대상 LLM의 작업에 특화된 행동을 재현하기 위해.
- 추출된 모델을 악성 공격 개발을 위한 샌드박스로 사용하여, AddSent와 같은 전이 가능한 공격에 특화하기 위해.
- 지식 전이의 정밀도를 측정하기 위해 SQuAD에서 정확일치(EM) 및 F1 점수를 사용해 성능을 측정하기 위해.
- 공격 전이 가능성 평가를 위해 추출된 모델에서 최적화된 공격을 원본 대상 LLM(예: ChatGPT-3.5-Turbo)에 적용하기 위해.
실험 결과
연구 질문
- RQ1ChatGPT-3.5-Turbo와 같은 생산용 LLM으로부터 API 쿼리와 자동 프롬프트 설계만으로 작업에 특화된 지식을 효과적으로 추출할 수 있는가?
- RQ2더 작은 정제된 모델이 질문 응답과 같은 특정 NLP 작업에서 대규모 LLM의 성능을 어느 정도 재현할 수 있는가?
- RQ3추출된 모델을 사용해 원본 대상 LLM에 대해 더 효과적인 악성 공격을 조작할 수 있는가?
- RQ4사용자가 생성한 추출된 모델에서 생산용 LLM으로의 공격 전이 가능성은 어느 정도인가?
- RQ5모델 추출의 비용이 실제로 이러한 공격의 실현 가능성과 확장성에 어떤 영향을 미치는가?
주요 결과
- Model Leeching은 ChatGPT-3.5-Turbo에서 작업에 특화된 지식을 성공적으로 추출하여 SQuAD 벤치마크에서 73%의 정확일치(EM) 유사도를 달성했다.
- 가장 뛰어난 성능을 보인 정제된 모델(RoBERTa-Large)은 대상 LLM의 SQuAD EM 및 F1 점수를 정확히 재현하여 고정밀도 지식 정제의 가능성을 입증했다.
- 추출된 모델에서 공격를 최적화한 AddSent 공격의 성공률은 26% 향상되었으며, 이는 원본 ChatGPT-3.5-Turbo에 전이될 때 11%의 성공률 향상으로 이어졌다.
- 전체 추출 과정에 소요된 비용은 단지 50달러의 API 요금에 불과하여, 이러한 공격가의 대규모 확장 가능성과 경제적 실현 가능성을 입증했다.
- 추출된 모델는 대상 LLM과 거의 동일한 응답 패턴과 오류 프로파일을 보였으며, 이는 행동의 의미적 및 문법적 복제를 의미한다.
- 본 연구는 Model Leeching을 통한 모델 추출이 효과적인 악성 공격 시나리오를 조작할 수 있음을 확인하며, 공개 접근이 가능한 LLM에서 중요한 보안 표면을 드러냈다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.