Skip to main content
QUICK REVIEW

[論文レビュー] Robust Encodings: A Framework for Combating Adversarial Typos

Erik Jones, Robin Jia|arXiv (Cornell University)|May 4, 2020
Adversarial Robustness in Machine Learning参考文献 32被引用数 8
ひとこと要約

この論文では、文を離散的で安定した符号化の集合へ写像することで、NLPモデルの悪意あるスペルミスに対する耐性を向上させる、タスクに依存しないフレームワークであるRobust Encodings (RobEn) を紹介する。安定性と忠実性を最適化することで、正確な耐性精度の計算が可能となり、BERTと組み合わせた場合、GLUEタスク全体で平均71.3%の耐性精度を達成する。これは、スペル訂正器に基づく従来の防御法よりも顕著に優れている。

ABSTRACT

Despite excellent performance on many tasks, NLP systems are easily fooled by small adversarial perturbations of inputs. Existing procedures to defend against such perturbations are either (i) heuristic in nature and susceptible to stronger attacks or (ii) provide guaranteed robustness to worst-case attacks, but are incompatible with state-of-the-art models like BERT. In this work, we introduce robust encodings (RobEn): a simple framework that confers guaranteed robustness, without making compromises on model architecture. The core component of RobEn is an encoding function, which maps sentences to a smaller, discrete space of encodings. Systems using these encodings as a bottleneck confer guaranteed robustness with standard training, and the same encodings can be used across multiple tasks. We identify two desiderata to construct robust encoding functions: perturbations of a sentence should map to a small set of encodings (stability), and models using encodings should still perform well (fidelity). We instantiate RobEn to defend against a large family of adversarial typos. Across six tasks from GLUE, our instantiation of RobEn paired with BERT achieves an average robust accuracy of 71.3% against all adversarial typos in the family considered, while previous work using a typo-corrector achieves only 35.3% accuracy against a simple greedy attack.

研究の動機と目的

  • モデルアーキテクチャを損なわせることなく、再訓練を必要としない、再利用可能でタスクに依存しない防御フレームワークを構築すること。
  • BERTのような最先端モデルと互換性がない、あるいはヒューリスティックな近似に依存する従来の防御の限界を克服するため、離散的符号化ボトルネックを導入すること。
  • 耐性を保証するための2つの主要な望ましい性質、すなわち安定性(摂動が少数の符号化にマッピングされること)と忠実性(下流モデルが元の入力で高い精度を維持すること)を確保すること。
  • 可視な符号化に基づく推論を活用することで、証明可能な訓練における緩い下界を避けることで、耐性精度の正確な計算を可能にすること。
  • 一度の構築で済ませられる符号化関数を事前に計算することで、複数のNLPタスクに一般化可能なフレームワークを実現すること。

提案手法

  • コアなメカニズムは、入力文をより小さな離散的符号化空間に写像する符号化関数 α であり、下流モデルのボトルネックとして機能する。
  • 安定性は、文のすべての摂動が少数の符号化にマッピングされることを保証することで実現され、トークンレベルの符号化におけるクラスタリング目的関数で定式化される。
  • 忠実性は、符号化が代表的品質を維持するように最適化されることで保たれ、下流モデルが元の入力で良好な性能を発揮できるようにする。
  • フレームワークは、安定性(γ=0)と忠実性(γ=1)のバランスを調整可能なハイパーパramータ γ を用いた階層的クラスタリングを採用し、トレードオフ分析が可能になる。
  • 符号化空間の明確な構造のおかげで、攻撃範囲内でのすべての有効な摂動を列挙することで、耐性精度の正確な計算が可能になる。これは、証明可能な訓練における緩い下界を避ける。
  • この手法は、BERTを含む任意の下流モデルと互換性があり、一度構築された符号化関数はタスク間で再利用可能である。

実験結果

リサーチクエスチョン

  • RQ1再訓練を各モデルやタスクごとに必要とせず、再利用可能でタスクに依存しない符号化フレームワークが、悪意あるスペルミスに対して保証された耐性を提供できるか?
  • RQ2離散的符号化空間において、安定性と忠実性を同時に最適化することで、耐性を確保しつつモデル性能を維持できるか?
  • RQ3スペル訂正器やデータ拡張のような従来の防御法と比較して、RobEnは特に最悪の攻撃条件下でもどれほど耐性精度を向上させられるか?
  • RQ4フレームワークはBERTのような最先端モデルにスケーリング可能か?また、凸緩和や下界を用いずに、耐性精度の正確な計算が可能か?
  • RQ5GLUEベンチマークのような多様なNLPタスクに、一度事前に計算された符号化関数を用いて一般化可能か?

主な発見

  • RobEnは、BERTと組み合わせた場合、GLUEの6つのタスクで平均71.3%の耐性精度を達成した。これは、グリーディ攻撃下で35.3%にとどまった、従来の最良の防御手法(スペル訂正器ベース)を顕著に上回る。
  • 符号化空間の明確な構造のおかげで、耐性精度は正確に計算可能であり、証明可能な訓練で一般的な緩い下界を回避できた。
  • RTEでは25%、SST-2では66%の例で、ある文のすべての摂動が1つの符号化にマッピングされる(|Bα(x)| = 1)ことが確認され、強い安定性が示された。
  • γ = 0.5 で得られる階層的クラスタリングベースの符号化が、SST-2で最高の耐性精度を達成し、安定性と忠実性の間の明確なトレードオフが確認された。
  • RobEnは内部の順列攻撃に対しても防御可能であり、同じ6つのタスクで81.4%の耐性精度を達成した。一方、標準のBERTは、86.2%から15.7%に急低下した。
  • フレームワークはタスク間で一般化可能である:同じ符号化関数を再訓練なしに複数のNLPタスクに再利用可能であり、タスクに依存しない耐性が実現された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。