Skip to main content
QUICK REVIEW

[논문 리뷰] Thieves on Sesame Street! Model Extraction of BERT-based APIs

Kalpesh Krishna, Gaurav Singh Tomar|arXiv (Cornell University)|2019. 10. 27.
Adversarial Robustness in Machine Learning참고 문헌 50인용 수 73
한 줄 요약

본 논문은 공격자가 쿼리 출력만으로도 BERT-large 기반 모델을 효과적으로 추출할 수 있음을 보이며, 무의미한 입력에서도 가능하고 멤버십 분류 및 워터마킹과 같은 방어책을 분석한다.

ABSTRACT

We study the problem of model extraction in natural language processing, in which an adversary with only query access to a victim model attempts to reconstruct a local copy of that model. Assuming that both the adversary and victim model fine-tune a large pretrained language model such as BERT (Devlin et al. 2019), we show that the adversary does not need any real training data to successfully mount the attack. In fact, the attacker need not even use grammatical or semantically meaningful queries: we show that random sequences of words coupled with task-specific heuristics form effective queries for model extraction on a diverse set of NLP tasks, including natural language inference and question answering. Our work thus highlights an exploit only made feasible by the shift towards transfer learning methods within the NLP community: for a query budget of a few hundred dollars, an attacker can extract a model that performs only slightly worse than the victim model. Finally, we study two defense strategies against model extraction---membership classification and API watermarking---which while successful against naive adversaries, are ineffective against more sophisticated ones.

연구 동기 및 목표

  • NLP API에서 BERT 기반 모델을 서비스하는 모델 추출 위험을 동기 부여하고 형식화한다.
  • 공격자가 실제 작업 데이터 없이도 강력한 NLP 모델을 재현할 수 있음을 보여준다.
  • 사전 학습 및 아키텍처 선택이 추출 품질에 미치는 영향을 평가한다.
  • 간단한 방어책의 한계를 논의하고 평가한다.

제안 방법

  • 피해자 모델 g_T를 NLP 작업용으로 미세 조정된 BERT 기반 시스템으로 정의한다.
  • 실제 학습 데이터 없이 입력-출력 쌍을 생성하기 위해 무작위 및 위키 기반의 작업별 쿼리 생성기와 휴리스틱을 사용한다.
  • 수집된 (x_i, g_T(x_i))에 대해 공개 BERT 기준선을 미세 조정하여 추출 모델 g'_T를 얻는다.
  • 원래 개발(dev) 세트에서의 정확도와 피해자 모델과 추출 모델 간의 일치도(Agreement)를 통해 추출을 평가한다.
  • 출력 유형(확률 vs. argmax)이 추출에 미치는 영향을 탐구한다.
  • 다른 공격자 아키텍처(BERT-large/base, XLNet) 및 학습 데이터 혼합(original/wiki/random)을 실험한다.
  • 멤버십 분류 및 워터마킹을 포함한 방어책을 테스트한다. 응답 불가 질문 설정도 포함한다.

실험 결과

연구 질문

  • RQ1적대적 사용자가 허용된 블랙 박스 BERT 기반 API에 무의미한 입력으로 쿼리하여 고성능 NLP 모델을 재현할 수 있는가?
  • RQ2쿼리 유형(random vs. wiki-derived)과 작업 휴리스틱이 추출 정확도 및 모델 동등성에 어떤 영향을 미치는가?
  • RQ3공격자 사전학습 및 아키텍처 불일치가 추출 성공에 어떤 영향을 미치는가?
  • RQ4멤버십 분류 및 워터마킹과 같은 간단한 방어책이 적응적 공격자에 대해 효과적인가?

주요 결과

  • 추출된 모델은 무의미한 입력으로 학습되었더라도 원래 개발 세트의 정확도에서 높은 성능을 달성한다.
  • 위키 기반 및 무작위 쿼리는 효과적인 추출을 만들어내며 목표 작업 정확도는 높고 피해자에 대한 일치도는 가변적이다.
  • 공격자를 더 강력한 모델(예: XLNet-large)로 사전학습시키면 피해자 아키텍처와 불일치가 있어도 추출 성능이 개선될 수 있다.
  • 일치하는 아키텍처는 일반적으로 추출을 향상시키지만, 더 강한 공격자 모델이 불일치를 능가할 수 있다(예: SQuAD에서 XLNet이 BERT 기반 공격자를 능가).
  • 멤버십 분류와 같은 방어책은 순진한 공격자를 느리게 만들 수는 있지만 적응형 공격자에 대해서는 불충분하며, 워터마킹은 워터마킹된 쿼리에서 도용을 드러낼 수는 있지만 완전한 해결책은 아니다.
  • 추출은 비용 효율적이며(종종 수백 달러) 여러 작업에서 피해자 모델과 거의 동등한 성능에 도달할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.