Skip to main content
QUICK REVIEW

[논문 리뷰] Imitation Attacks and Defenses for Black-box Machine Translation Systems

Eric Wallace, Mitchell Stern|arXiv (Cornell University)|2020. 04. 30.
Adversarial Robustness in Machine Learning참고 문헌 50인용 수 20
한 줄 요약

이 논문은 쿼리 기반 복제 학습을 통해 블랙박스 기계 번역(MT) 시스템을 도용할 수 있음을 보여주며, 고자원 및 저자원 언어 쌍에서 생산성 수준에 근접한 성능(0.6 BLEU 이내)을 달성한다. 또한 이러한 복제 모델에서 생성된 적대적 예제가 생산 시스템으로 성공적으로 전이됨을 입증하고, 복제 모델 품질과 공격 전이 가능성 저하를 위해 병행 번역을 삽입하는 방식의 방어 기법을 제안한다. 이는 BLEU 점수와 추론 속도 감소를 감수하는 대가로 이뤄진다.

ABSTRACT

Adversaries may look to steal or attack black-box NLP systems, either for financial gain or to exploit model errors. One setting of particular interest is machine translation (MT), where models have high commercial value and errors can be costly. We investigate possible exploits of black-box MT systems and explore a preliminary defense against such threats. We first show that MT systems can be stolen by querying them with monolingual sentences and training models to imitate their outputs. Using simulated experiments, we demonstrate that MT model stealing is possible even when imitation models have different input data or architectures than their target models. Applying these ideas, we train imitation models that reach within 0.6 BLEU of three production MT systems on both high-resource and low-resource language pairs. We then leverage the similarity of our imitation models to transfer adversarial examples to the production systems. We use gradient-based attacks that expose inputs which lead to semantically-incorrect translations, dropped content, and vulgar model outputs. To mitigate these vulnerabilities, we propose a defense that modifies translation outputs in order to misdirect the optimization of imitation models. This defense degrades the adversary's BLEU score and attack success rate at some cost in the defender's BLEU and inference speed.

연구 동기 및 목표

  • 블랙박스 MT 시스템이 쿼리 기반 복제 학습을 통해 역설계될 수 있는지 조사하기.
  • 복제 모델에서 생성된 적대적 예제가 생산 시스템으로 전이 가능한지 타당성 평가하기.
  • 복제 모델 도용과 적대적 전이를 완화하면서 핵심 모델 기능을 유지하는 방어 기법 개발하기.
  • 복제 공격 방어에서 보안, 성능, 추론 효율성 간의 트레이드오프 평가하기.

제안 방법

  • 블랙박스 MT API에서 쿼리한 단일어 문장을 사용해 복제 모델을 훈련하고, 표본 출력을 레이블링하여 지도 미세조정 수행.
  • 복제 모델에 기반한 기울기 기반 공격를 사용해 생산 시스템으로 전이 가능한 적대적 예제 생성.
  • 입력당 다수의 번역 후보를 생성하고, 복제 모델의 최적화를 혼란스럽게 만들기 위해 대체 출력을 선택하는 방식의 방어 구현.
  • 출력 왜곡 정도를 제어하기 위해 BLEU 매칭 임계치(70, 80, 90)를 적용하고, 성능 손실 측정.
  • 복제 모델의 BLEU 저하와 적대적 예제 전이 비율 측정을 통해 방어 효과 평가.
  • 400개의 IWSLT 예제로 구성된 검증 세트를 사용해 방어 적용 전후 공격 전이 성공률 측정.

실험 결과

연구 질문

  • RQ1어떤 공격자가 쿼리 액세스와 단일어 데이터만을 사용해 생산 MT 모델을 성공적으로 도용할 수 있는가?
  • RQ2복제 모델에서 생성된 적대적 예제가 원본 생산 MT 시스템으로 얼마나 잘 전이되는가?
  • RQ3복제 모델 훈련을 혼란스럽게 만들기 위해 번역 출력을 수정하는 방어 기법의 효과는 어떠한가?
  • RQ4방어 효과성과 원본 MT 시스템의 성능(BLEU) 및 속도 간의 트레이드오프는 어떠한가?

주요 결과

  • 복제 모델은 고자원 및 저자원 언어 쌍에서 Google, Bing, Systran의 세 개의 생산 MT 시스템과 0.6 BLEU 이내 성능을 달성했다.
  • 방어가 없을 경우 복제 모델에서 생산 시스템으로의 적대적 공격 전이 성공률는 38%였다.
  • 70 BLEU 매칭 임계치에서 제안된 방어 기법은 적대적 전이 비율을 27.0%로 낮혀 공격 성공률의 26% 상대 감소를 나타냈다.
  • 방어 적용으로 복제 모델의 BLEU는 최대 1.8점 감소(34.5 → 32.7), 피해자 모델의 BLEU는 0.8점 감소(34.6 → 33.8)를 기록했다.
  • 방어 적용 시 피해자 모델과 복제 모델 간의 상호 BLEU는 69.7에서 53.5로 감소해 기능적 유사성 저하를 확인했다.
  • 방어 기법은 100개의 후보 번역 생성 단계를 추가해 추론 비용을 증가시키고 방어자 BLEU를 저하시켰지만, 방어자에게 측정 가능한 경쟁 우위를 제공했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.