Skip to main content
QUICK REVIEW

[論文レビュー] Metamorphic Relation Based Adversarial Attacks on Differentiable Neural Computer

Alvin Chan, Lei Ma|arXiv (Cornell University)|Sep 7, 2018
Adversarial Robustness in Machine Learning参考文献 27被引用数 14
ひとこと要約

本稿では、自然言語質問応答タスクにおける堅牢性を評価するために、Differentiable Neural Computers (DNCs) に対するメタモーフィック関係ベースの adversarial 攻撃を提案する。Pick-n-Plug や Pick-Permute-Plug といった自動戦略を用いて文法的に正しいが意味的に変更された入力を生成することで、DNC のメモリ操作(特に読み取り、書き込み、消去機能)を攪乱し、ほぼ完璧なベースライン精度にもかかわらず顕著な性能低下を引き起こす。

ABSTRACT

Deep neural networks (DNN), while becoming the driving force of many novel technology and achieving tremendous success in many cutting-edge applications, are still vulnerable to adversarial attacks. Differentiable neural computer (DNC) is a novel computing machine with DNN as its central controller operating on an external memory module for data processing. The unique architecture of DNC contributes to its state-of-the-art performance in tasks which requires the ability to represent variables and data structure as well as to store data over long timescales. However, there still lacks a comprehensive study on how adversarial examples affect DNC in terms of robustness. In this paper, we propose metamorphic relation based adversarial techniques for a range of tasks described in the natural processing language domain. We show that the near-perfect performance of the DNC in bAbI logical question answering tasks can be degraded by adversarially injected sentences. We further perform in-depth study on the role of DNC's memory size in its robustness and analyze the potential reason causing why DNC fails. Our study demonstrates the current challenges and potential opportunities towards constructing more robust DNCs.

研究の動機と目的

  • 自然言語処理における adversarial 攻撃に対して Differentiable Neural Computers (DNCs) の堅牢性を調査すること。
  • テキスト入力の離散的かつ微分不能な性質のため、NLP における adversarial 例の生成という課題に対処すること。
  • DNC の堅牢性に与えるメモリサイズの役割を評価すること。
  • adversarial 入力が DNC コントローラーの制御信号(読み取り、書き込み、消去機能)にどのように影響を与えるかを分析すること。

提案手法

  • 文法的正しさと意味的整合性を保ったまま NLP タスクにおける adversarial 例を生成するためのメタモーフィック関係ベースのフレームワークを提案する。
  • 自動的かつスケーラブルな攻撃戦略として、Pick-n-Plug および Pick-Permute-Plug を導入し、訓練またはテストシーケンスに adversarial 文を挿入する。
  • コントローラーの制御信号(キー、ベクトル、ゲート値)を、クリーンな入力と adversarial 入力の間でコサイン類似度と KL 発散を用いて比較する。
  • adversarial 効果の局所化を図るため、入力の3つのセグメント(ストーリー、adversarial 文、質問)におけるコントローラー動作を分析する。
  • 攻撃の成功度と性能低下を評価するため、bAbI タスク #19 をベンチマークとして用いる。
  • KL 発散を用いてゲート値の分布(フリー、割り当て、書き込み、消去)を比較し、adversarial 入力下での顕著な乖離を検出する。

実験結果

リサーチクエスチョン

  • RQ1メタモーフィック関係ベースの adversarial 攻撃は、自然言語質問応答タスクにおける DNC の性能を効果的に低下させることができるか?
  • RQ2adversarial 文の挿入は、コントローラーの制御信号に反映される DNC のメモリ操作(読み取り、書き込み、消去)にどのように影響を与えるか?
  • RQ3DNC のメモリサイズを増加させることで、このような adversarial 攻撃に対する堅牢性が顕著に向上するか?
  • RQ4入力の位置、コンテンツタイプ、長さが、DNC に対する adversarial 攻撃の成功に与える影響は何か?

主な発見

  • 提案された adversarial 攻撃は、bAbI タスク #19 において DNC の性能を著しく低下させ、文法的に正しい入力にもかかわらず、ほぼ完璧な精度から顕著に低い水準へと低下させた。
  • KL 発散分析により、成功した攻撃下では、特に割り当てゲートと書き込みゲートのゲート値に、クリーンな入力または失敗した攻撃と比較して顕著な乖離が見られた。
  • DNC コントローラーのキーとベクトル間のコサイン類似度は、adversarial セグメントで顕著に低下した(例:UAA と SAA 間の書き込みキーで 0.8593)。これは、信号の著しい攪乱を示している。
  • ゲート値における最大の KL 発散は、割り当てゲートと書き込みゲートの adversarial セグメントで観察され、これらの操作が攻撃の主な標的であると考えられる。
  • より大きなメモリサイズは、堅牢性の向上に限定的な寄与しか示さず、メモリ容量そのものがこのような攻撃に対する脆弱性を緩和しないことを示している。
  • 制御信号の分析から、adversarial 攻撃は DNC の読み取り、書き込み、消去機能を攪乱しており、特にコントローラーのゲート値と注釈メカニズムに顕著な影響が見られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。