[논문 리뷰] Killing Two Birds with One Stone: Stealing Model and Inferring Attribute from BERT-based APIs.
이 논문은 BERT 기반 기계학습 as a 서비스 (MLaaS) API를 대상으로 하는 이중 공격 프레임워크를 제시한다: 최소한의 쿼리로 미세조정된 BERT 모델을 도용하는 효과적인 모델 추출 공격과, 민감한 훈련 데이터 속성을 드러내는 속성 유추 공격. 저자는 이러한 공격이 실제 환경에서 가능하다는 것을 입증하며, 상용 BERT API에서 심각한 개인정보 유출 위험을 드러낸다.
The advances in pre-trained models (e.g., BERT, XLNET and etc) have largely revolutionized the predictive performance of various modern natural language processing tasks. This allows corporations to provide machine learning as a service (MLaaS) by encapsulating fine-tuned BERT-based models as commercial APIs. However, previous works have discovered a series of vulnerabilities in BERT- based APIs. For example, BERT-based APIs are vulnerable to both model extraction attack and adversarial example transferrability attack. However, due to the high capacity of BERT-based APIs, the fine-tuned model is easy to be overlearned, what kind of information can be leaked from the extracted model remains unknown and is lacking. To bridge this gap, in this work, we first present an effective model extraction attack, where the adversary can practically steal a BERT-based API (the target/victim model) by only querying a limited number of queries. We further develop an effective attribute inference attack to expose the sensitive attribute of the training data used by the BERT-based APIs. Our extensive experiments on benchmark datasets under various realistic settings demonstrate the potential vulnerabilities of BERT-based APIs.
연구 동기 및 목표
- 실제 MLaaS 환경에서 쿼리 기반 모델 추출 공격를 통해 BERT 기반 모델을 도용할 수 있는지의 가능성을 조사하기 위해.
- BERT 모델의 높은 표현 능력에도 불구하고, 훈련 데이터의 민감한 속성이 추출된 모델에서 어떻게 유추될 수 있는지 탐색하기 위해.
- 실제 쿼리 제약 조건과 다양한 벤치마크 데이터셋 하에서 두 공격의 실용성과 효과성을 평가하기 위해.
- 산업 전반에 널리 배포된 상용 BERT 기반 API의 개인정보 유출 취약성을 폭 드러내기 위해.
제안 방법
- 저자는 활성 학습과 쿼리 전략 최적화를 활용해 쿼리 수를 최소화하면서 타겟 BERT 모델을 재구성하는 쿼리 효율적인 모델 추출 공격를 설계하였다.
- 각 쿼리당 정보 수확을 극대화하기 위해 기울기 기반 쿼리 생성 방법을 사용하여 추출된 모델의 정확도를 향상시켰다.
- 추출된 모델의 내부 표현과 예측 패턴을 분석하여 훈련 데이터의 민감한 속성을 유추하는 속성 유추 공격를 개발하였다.
- 공격 파이프라인은 두 단계 과정으로 구성된다: 먼저 모델을 도둑맞고, 그 다음에 모델 분석을 통해 속성 泄露를 탐지한다.
- 실제 악성 공격 조건을 시뮬레이션하기 위해 표준 NLP 벤치마크 데이터셋에서 실제 쿼리 제한 조건 하에 실험을 수행하였다.
실험 결과
연구 질문
- RQ1악성 공격자는 제한된 수의 쿼리만으로 상용 API에서 미세조정된 BERT 모델을 효과적으로 추출할 수 있는가?
- RQ2추출된 모델에서 훈련 데이터의 민감한 속성은 어느 정도까지 유추될 수 있는가?
- RQ3BERT 기반 API에서의 모델 과적합 성향이 속성 유추 공격의 가능성과 성공률에 어떤 영향을 미치는가?
- RQ4실제 쿼리 제약 조건과 다양한 데이터 분포 하에서 이러한 공격의 실용적 한계와 성공률는 어떠한가?
주요 결과
- 모델 추출 공격는 몇 백 개의 쿼리만으로도 높은 정밀도로 타겟 BERT 모델을 재구성하여 높은 실용성 가능성을 입증하였다.
- 속성 유추 공격는 추출된 모델에서 성별 또는 정치적 소속과 같은 민감한 속성을 유추하는 데 상당한 성공을 거두었다.
- 미세조정된 BERT 모델의 과적합 성향에도 불구하고, 저자는 모델 출력에 측정 가능하고 악용 가능한 패턴을 관찰하여 속성 정보가 泄露됨을 확인하였다.
- 이 공격들은 여러 벤치마크 데이터셋에서 효과적이었으며, 실제 세계의 BERT 기반 MLaaS 구현에 광범위하게 적용 가능함을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.