Skip to main content
QUICK REVIEW

[論文レビュー] Achieving Verified Robustness to Symbol Substitutions via Interval Bound Propagation

Po-Sen Huang, Robert Stanforth|arXiv (Cornell University)|Sep 3, 2019
Adversarial Robustness in Machine Learning参考文献 43被引用数 18
ひとこと要約

本稿では、同義語置換および文字置換攻撃に対する頑健性を保証するための形式的検証手法を提案する。Interval Bound Propagation (IBP) を用い、摂動を単体としてモデル化し、修正された目的関数でモデルを訓練することで、定数時間の検証を実現し、全検証下で敵対的訓練を上回る高い検証済み精度を達成する。

ABSTRACT

Neural networks are part of many contemporary NLP systems, yet their empirical successes come at the price of vulnerability to adversarial attacks. Previous work has used adversarial training and data augmentation to partially mitigate such brittleness, but these are unlikely to find worst-case adversaries due to the complexity of the search space arising from discrete text perturbations. In this work, we approach the problem from the opposite direction: to formally verify a system's robustness against a predefined class of adversarial attacks. We study text classification under synonym replacements or character flip perturbations. We propose modeling these input perturbations as a simplex and then using Interval Bound Propagation -- a formal model verification method. We modify the conventional log-likelihood training objective to train models that can be efficiently verified, which would otherwise come with exponential search complexity. The resulting models show only little difference in terms of nominal accuracy, but have much improved verified accuracy under perturbations and come with an efficiently computable formal guarantee on worst case adversaries.

研究の動機と目的

  • シンボル置換攻撃に対して、テキスト分類モデルの形式的で証明可能な頑健性保証を提供すること。
  • 最悪の敵対的攻撃者に対して保証が欠如する敵対的訓練の限界を解消すること。
  • 区間境界伝播(IBP)を用いた効率的かつスケーラブルな検証を可能にする、検証可能な訓練目的関数の開発。
  • 摂動空間のサイズと単語埋め込みの質が検証境界に与える影響を調査すること。
  • 名目上の精度を損なわせることなく、検証可能な頑健性が達成可能であることを示すこと。

提案手法

  • 入力空間における摂動(同義語置換または文字置換)を、すべての意味的に不変な変更を表す単体としてモデル化する。
  • 区間境界伝播(IBP)を適用し、摂動単体全体にわたるモデル出力のタイトで効率的な境界を計算する。
  • 標準的な対数尤度訓練目的関数を修正し、IBP検証に適したモデルを促進するようにし、推論時の頑健性を向上させる。
  • カウンター適合単語埋め込みを用いることで、摂動単体の体積を低減し、IBP境界をタイトにし、検証済み精度を向上させる。
  • 全検証オラクルを用いて頑健性を評価し、敵対的訓練およびデータ拡張ベースラインと比較する。
  • 軸に平行なボックスを活用し、各層を通過する際に区間境界を伝播させ、ログィット空間における効率的な最悪ケース解析を可能にする。

実験結果

リサーチクエスチョン

  • RQ1IBPによる形式的検証は、同義語置換および文字置換攻撃に対して、テキスト分類モデルの証明可能な頑健性保証を提供できるか?
  • RQ2摂動空間のサイズは、IBPに基づく検証および敵対的訓練の有効性にどのように影響するか?
  • RQ3カウンター適合単語埋め込みは、IBP境界のタイトさと検証済み精度をどの程度向上させるか?
  • RQ4全検証下で評価した場合、検証可能な訓練は敵対的訓練よりも優れた頑健性をもたらすか?
  • RQ5さまざまな摂動半径において、IBP検証の計算コストは全検索と比較してどの程度か?

主な発見

  • IBPで訓練されたモデルは、SST-characterにおいてδ=3の条件下で98.4%の検証済み精度を達成し、全検証下で敵対的訓練モデルを著しく上回る。
  • IBP検証コストは定数であり、無視できるほど小さいが、SST-characterのδ=3では全検証に最大140万回の順方向伝搬が必要であり、スケールアップには非現実的である。
  • カウンター適合埋め込みを用いることで、δ=1の条件下でIBP検証済み精度が最大33.2%向上し、単体体積の低減が境界のタイトさを向上させることを示した。
  • 敵対的訓練は最悪の敵対的攻撃者に一般化できず、全検証下での劣悪な性能が示され、誤った頑健性の錯覚をもたらすことが明らかになった。
  • 名目上のテスト精度は、すべてのモデルでほぼ変化がなく(1%以内)、検証可能性が標準性能を損なわないことを示している。
  • 本手法は効率的にスケーリング可能である:IBP検証は全検索と比較して桁違いに高速であり、頑健なNLPシステムの実用的導入を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。