Skip to main content
QUICK REVIEW

[論文レビュー] STRATA: Building Robustness with a Simple Method for Generating Black-box Adversarial Attacks for Models of Code.

Jacob M. Springer, Bryn Marie Reinstadler|arXiv (Cornell University)|Sep 28, 2020
Adversarial Robustness in Machine Learning参考文献 40被引用数 4
ひとこと要約

本稿では、意味的意味を保持するコードモデルにおける敵対的例を生成するシンプルで効率的なブラックボックス手法であるSTRATAを提案する。勾配ベースの手法よりも計算コストを低く抑えながらも、敵対的訓練によって耐性を向上させ、攻撃時にはコード2セグのF1スコアを42%低下させ、防御によって元のベースラインの99%まで回復させる。

ABSTRACT

Adversarial examples are imperceptible perturbations in the input to a neural model that result in misclassification. Generating adversarial examples for source code poses an additional challenge compared to the domains of images and natural language, because source code perturbations must adhere to strict semantic guidelines so the resulting programs retain the functional meaning of the code. We propose a simple and efficient black-box method for generating state-of-the-art adversarial examples on models of code. Our method generates untargeted and targeted attacks, and empirically outperforms competing gradient-based methods with less information and less computational effort. We also use adversarial training to construct a model robust to these attacks; our attack reduces the F1 score of code2seq by 42%. Adversarial training brings the F1 score on adversarial examples up to 99% of baseline.

研究の動機と目的

  • 機能的意味を保持しながら検出を回避するコードモデルにおける敵対的例の生成という課題に対処すること。
  • 最小限のモデル情報と計算リソースを要するブラックボックス攻撃手法を開発すること。
  • 効果的な敵対的訓練を通じて、敵対的例に対してモデルの耐性を向上させること。
  • 攻撃および防御の有効性を現実のコードモデルのシナリオにおいて評価すること。

提案手法

  • STRATAは、元のプログラムの機能を保持するように、小さな意味的に妥当な摂動をソースコードに適用することで敵対的例を生成する。
  • この手法はブラックボックス設定で動作し、ターゲットモデルの予測結果のみを必要とし、勾配のアクセスは不要である。
  • 文法的および意味的コード変換の探索に基づくアプローチを用い、誤分類を引き起こす摂動を特定する。
  • 攻撃は非標的および標的の両方のバージョンをサポートしており、モデルの耐性の柔軟な評価が可能である。
  • 生成された敵対的例を用いて敵対的訓練を実施し、モデルの微調整と耐性の向上を図る。
  • このアプローチは効率的であるように設計されており、計算オーバーヘッドを最小限に抑えつつ、攻撃成功率を最大化する。

実験結果

リサーチクエスチョン

  • RQ1意味的正しさを保持しながら高い成功率を達成できるコードモデル向けのブラックボックス敵対的攻撃を設計できるか?
  • RQ2提案手法は勾配ベースの手法と比較して、攻撃効果性および計算コストの面でどのように異なるか?
  • RQ3敵対的訓練により、提案された攻撃に対してコードモデルをどの程度防御できるか?
  • RQ4攻撃がモデル性能に与える影響は何か、また防御によって耐性はどの程度回復できるか?

主な発見

  • STRATAは、勾配ベースの手法よりも著しく少ない計算リソースで、コードモデルにおける最先端の攻撃パフォーマンスを達成する。
  • 攻撃によりコード2セグモデルのF1スコアは敵対的例において42%低下し、高い有効性が示された。
  • STRATAが生成した敵対的例を用いた敵対的訓練により、モデルのF1スコアは元のベースラインの99%まで回復した。
  • この手法は非標的および標的の両方の攻撃シナリオで有効であり、広範な適用性を示している。
  • コードの意味的制約にもかかわらず攻撃は効果を示し、その耐性と実用性が裏付けられた。
  • 敵対的訓練による防御は、高いモデル精度を維持しながら、敵対的入力に対する耐性を顕著に向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。