[논문 리뷰] Model Extraction and Adversarial Transferability, Your BERT is Vulnerable!
이 논문은 BERT 기반 API 서비스가 쿼리 접근이 제한된 상태에서도 고정밀도 복제 모델을 생성할 수 있는 모델 추출 공격에 취약하다는 것을 입증한다. 악성 공격자는 단순한 쿼리만으로도 원본 모델의 고정밀도 복제본을 재구성할 수 있으며, 이 복제 모델을 통해 원본 BERT 모델에 대해 매우 이식 가능한 대비 공격을 수행할 수 있다. 이는 아키텍처 불일치 조건에서도 성립하며, 소프트 레이블이나 변형 기반 방어 전략은 정확도를 희생시키지 않고선 이러한 위협을 완전히 완화하지 못한다.
Natural language processing (NLP) tasks, ranging from text classification to text generation, have been revolutionised by the pre-trained language models, such as BERT. This allows corporations to easily build powerful APIs by encapsulating fine-tuned BERT models for downstream tasks. However, when a fine-tuned BERT model is deployed as a service, it may suffer from different attacks launched by malicious users. In this work, we first present how an adversary can steal a BERT-based API service (the victim/target model) on multiple benchmark datasets with limited prior knowledge and queries. We further show that the extracted model can lead to highly transferable adversarial attacks against the victim model. Our studies indicate that the potential vulnerabilities of BERT-based API services still hold, even when there is an architectural mismatch between the victim model and the attack model. Finally, we investigate two defence strategies to protect the victim model and find that unless the performance of the victim model is sacrificed, both model ex-traction and adversarial transferability can effectively compromise the target models
연구 동기 및 목표
- 상용 API를 통해 제한된 쿼리 접근 권한만으로 BERT 기반 분류 모델을 추출할 수 있는지 탐구하기.
- 추출된 모델에서 생성한 대비 예제가 원본 공격 대상 모델로 이식 가능한지 평가하기.
- 일반적인 방어 전략인 소프트 레이블링과 예측 변형이 모델 추출 및 대비 이식성 공격에 얼마나 효과적인지 평가하기.
- 공격 대상 모델과 추출된 모델 간 아키텍처 불일치가 공격 성능에 미치는 영향을 분석하기.
- 실제 상용 NLP API 환경에서 이러한 공격의 실제 비용과 실현 가능성 수치를 도출하기.
제안 방법
- 공격는 두 단계로 진행된다: 첫 번째로, 공격 대상 BERT API에 대한 쿼리를 통해 입력-예측 쌍을 수집한다.
- 두 번째로, 수집된 쿼리-예측 데이터를 바탕으로 공격자가 로컬에서 추출 모델을 학습시켜 공격 대상의 행동을 모방한다.
- 다음으로, 타겟된 변형(예: 철자 오류 기반 공격)을 사용해 추출된 모델에서 대비 예제를 생성하여 이식성의 잠재력을 악용한다.
- 이식성은 추출된 모델에서 생성된 대비 예제가 원본 공격 대상 API에서 테스트되었을 때의 성공률로 측정된다.
- 방어 전략으로는 소프트 레이블링(소프트맥스의 온도 스케일링)과 예측 변형(로지트에 가우시안 노이즈 추가)이 포함된다.
- 실험은 다양한 NLP 데이터셋(예: AG News, Yelp, Blog)에서 수행되었으며, 쿼리 예산과 아키텍처 구성의 다양성을 고려하였다.
실험 결과
연구 질문
- RQ1악성 공격자가 제한된 수의 쿼리만으로도 블랙박스 API에서 고정밀도 BERT 기반 모델을 추출할 수 있는가?
- RQ2아키텍처가 다를 경우에도 추출된 모델에서 생성된 대비 예제가 원본 공격 대상 모델로 이식 가능한 정도는 어느 정도인가?
- RQ3일반적인 방어 수단인 소프트 레이블링과 예측 변형이 모델 추출 및 대비 이식성 공격에 얼마나 효과적인가?
- RQ4공격 대상 모델과 추출된 모델 간 아키텍처 불일치가 공격의 효과성에 영향을 미치는가?
- RQ5실제 상용 NLP 서비스 환경에서 이러한 공격의 실질적 비용과 실행 가능성은 어떠한가?
주요 결과
- 공격 대상 모델과 추출 모델이 동일한 아키텍처를 사용할 경우, BERT-large에서 최대 91.0%의 정확도로 모델 추출이 성공하여 고정밀도 모방이 가능함을 입증하였다.
- BERT-large 추출 모델을 사용할 경우, 원본 공격 대상 모델에서 대비 이식성 공격의 성공률이 59.3%에 달했으며, 블랙박스 기반 기존 방법보다 뚜렷이 높았다.
- 아키텍처 불일치(예: BERT-base 추출 모델이 BERT-large 공격 대상 모델을 공격하는 경우)가 존재하더라도 대비 이식성 공격은 여전히 효과적이었으며, 성공률 42.7%를 기록했다.
- 온도 스케일링(τ = 0.5 또는 5.0)을 적용한 소프트 레이블링은 대비 이식성 공격을 감소시켰지만, 모델 추출은 완전히 방지하지 못했으며, 정확도는 유지되었다.
- 표준편차 σ = 0.50로 예측 변형을 적용한 결과, 이식성은 감소했지만, 공격 대상 모델의 정확도는 63.2%로 떨어졌으며, 모델 추출은 여전히 성공하였다.
- 공격 전용 파이프라인은 단지 $7.10의 비용으로도 실행 가능하여, 낮은 실질적 비용과 실제 상용 서비스 환경에서의 실행 가능성을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.