Skip to main content
QUICK REVIEW

[論文レビュー] Imitation Attacks and Defenses for Black-box Machine Translation Systems

Eric Wallace, Mitchell Stern|arXiv (Cornell University)|Apr 30, 2020
Adversarial Robustness in Machine Learning参考文献 50被引用数 20
ひとこと要約

本稿では、クエリベースの模倣学習を用いてブラックボックス機械翻訳(MT)システムをスニフィング可能であることを示しており、高リソースおよび低リソース言語対において、生産環境性能にほぼ等しい性能(0.6 BLEU以内)を達成している。さらに、これらの模倣モデル上で生成された adversarial examples が生産システムへ効果的に転送されることを示しており、代替翻訳を挿入することにより模倣モデルの品質と攻撃転送性を低下させる防御手法を提案している。その代償として、BLEUスコアと推論速度が低下する。

ABSTRACT

Adversaries may look to steal or attack black-box NLP systems, either for financial gain or to exploit model errors. One setting of particular interest is machine translation (MT), where models have high commercial value and errors can be costly. We investigate possible exploits of black-box MT systems and explore a preliminary defense against such threats. We first show that MT systems can be stolen by querying them with monolingual sentences and training models to imitate their outputs. Using simulated experiments, we demonstrate that MT model stealing is possible even when imitation models have different input data or architectures than their target models. Applying these ideas, we train imitation models that reach within 0.6 BLEU of three production MT systems on both high-resource and low-resource language pairs. We then leverage the similarity of our imitation models to transfer adversarial examples to the production systems. We use gradient-based attacks that expose inputs which lead to semantically-incorrect translations, dropped content, and vulgar model outputs. To mitigate these vulnerabilities, we propose a defense that modifies translation outputs in order to misdirect the optimization of imitation models. This defense degrades the adversary's BLEU score and attack success rate at some cost in the defender's BLEU and inference speed.

研究の動機と目的

  • ブラックボックスMTシステムがクエリベースの模倣学習を用いて逆引き可能かどうかを調査すること。
  • 模倣モデル上で生成された adversarial examples が生産MTシステムへ転送可能かどうかを評価すること。
  • 模倣学習の盗難および adversarial transfer を軽減しつつ、コアなモデル機能を維持する防御メカニズムを開発すること。
  • 模倣攻撃に対する防御における、セキュリティ、パフォーマンス、推論効率のトレードオフを評価すること。

提案手法

  • ブラックボックスMT APIからクエリされた単語句を用いて、教師あり微調整のための出力をラベル付けすることで、模倣モデルを訓練する。
  • 模倣モデルに対して勾配ベースの攻撃を適用し、生産システムへ転送可能な adversarial examples を生成する。
  • 入力ごとに複数の翻訳仮説を生成し、そのうちの代替出力を選択することで、模倣モデルの最適化を混乱させる防御を実装する。
  • 出力の摂動度合いを制御するため、BLEUマッチ閾値(70, 80, 90)を適用し、モデルパフォーマンスへのトレードオフを測定する。
  • 模倣モデルのBLEUスコアの低下と adversarial examples の転送率を測定することで、防御の有効性を評価する。
  • 防御適用前後における攻撃転送成功率を測定するために、400例のIWSLTバリデーションセットを用いる。

実験結果

リサーチクエスチョン

  • RQ1攻撃者がクエリアクセスと単語句データのみを用いて、生産MTモデルを成功裏にスニフィングできるか?
  • RQ2模倣モデル上で生成された adversarial examples が、元の生産MTシステムへどの程度転送可能か?
  • RQ3模倣モデルの学習を混乱させるために翻訳出力を変更する防御は、どの程度有効か?
  • RQ4防御の有効性と、元のMTシステムのパフォーマンス(BLEU)および速度のトレードオフは何か?

主な発見

  • 模倣モデルは、3つの生産MTシステム(Google、Bing、Systran)の両方の高リソースおよび低リソース言語対において、0.6 BLEU以内の性能を達成した。
  • 防御なしでは、模倣モデル上で生成された adversarial 攻撃が生産システムへ38%の成功率で転送された。
  • 70 BLEUマッチ閾値において、提案防御により adversarial 転送率が27.0%に低下し、攻撃成功率が相対的に26%低下した。
  • 防御により、模倣モデルのBLEUが最大1.8ポイント低下(34.5から32.7)、被害者モデルのBLEUは0.8ポイント低下(34.6から33.8)した。
  • 防御下では、被害者モデルと模倣モデル間の相互BLEUが69.7から53.5に低下し、機能的類似性が低下した。
  • 防御は100の仮説生成ステップを導入し、推論コストを増加させ、防御者のBLEUを低下させたが、防御者に測定可能な競争優位性を提供した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。