Skip to main content
QUICK REVIEW

[論文レビュー] Backdoor Attack and Defense for Deep Regression

Xi Li, George Kesidis|arXiv (Cornell University)|Sep 6, 2021
Adversarial Robustness in Machine Learning参考文献 13被引用数 5
ひとこと要約

本稿では、検出を回避するために入力空間内で局所化された悪意あるサンプルを用いたデータ汚染による深層回帰モデル向けの標的型バックドア攻撃を提案する。さらに、勾配に基づく局所誤差最大化器を用いて汚染されたサンプルを特定・削除する防御手法を導入し、金融デリバティブ価格設定タスクにおいて、攻撃誤差を50%削減しながらも、高いテスト精度を維持した。

ABSTRACT

We demonstrate a backdoor attack on a deep neural network used for regression. The backdoor attack is localized based on training-set data poisoning wherein the mislabeled samples are surrounded by correctly labeled ones. We demonstrate how such localization is necessary for attack success. We also study the performance of a backdoor defense using gradient-based discovery of local error maximizers. Local error maximizers which are associated with significant (interpolation) error, and are proximal to many training samples, are suspicious. This method is also used to accurately train for deep regression in the first place by active (deep) learning leveraging an "oracle" capable of providing real-valued supervision (a regression target) for samples. Such oracles, including traditional numerical solvers of PDEs or SDEs using finite difference or Monte Carlo approximations, are far more computationally costly compared to deep regression.

研究の動機と目的

  • 訓練データセットにおける標的型データ汚染を通じて、深層回帰モデルに対する新規なバックドア攻撃を提示すること。
  • 正当なデータの周囲に汚染されたサンプルを局所化することが、攻撃成功に不可欠であることを示すこと。
  • 勾配に基づく局所誤差最大化器を用いてバックドア攻撃を検出・緩和する防御メカニズムを開発すること。
  • 高価なオラクルを用いて訓練された深層ニューラルネットワークを用いて、実世界の金融デリバティブ価格設定タスクで手法を評価すること。
  • 疑わしい局所誤差最大化器に近いサンプルを削除することで、通常の推論精度に悪影響を与えることなく攻撃性能を顕著に低下させることを示すこと。

提案手法

  • 攻撃は、満期までの時間、ボラティリティ、金利に関する制約を満たす入力空間の局所的領域に、特定のトレiggersパターンを有する誤分類された訓練サンプルを挿入する。
  • 防御は、DNNとオラクル間の誤差の局所的最大値を特定するために勾配上昇法を用い、高い補間誤差を示す領域に注目する。
  • 局所誤差最大化器は、誤差が著しく高く、かつ多数の訓練サンプルに近接している(ユークリッド距離 < 0.1)場合に、疑わしいものとしてマークされる。
  • 本手法はアクティブラーニングの原則を活用し、疑わしいサンプルを削除した後、オラクルを用いてモデルを再訓練する。
  • 再訓練では、クリーンデータ(α = 0.99)に高い重みを、検出された悪意あるサンプルに低い重みを割り当てる加重MSE目的関数を用いる。
  • 訓練サンプルの近接性をガウス・ミックスモデルなどの密度モデルに置き換えることで、近接性のハイパーパrameterに依存しないように防御を強化できる。

実験結果

リサーチクエスチョン

  • RQ1局所化された訓練セットにおけるデータ汚染を通じて、深層回帰モデルにバックドアを効果的に埋め込むことができるか?
  • RQ2なぜ、汚染されたサンプルの局所化が、このような攻撃の成功に不可欠なのか?
  • RQ3勾配に基づく局所誤差最大化器は、深層回帰モデルにおけるバックドアトレiggersを信頼性高く検出できるか?
  • RQ4疑わしい局所誤差最大化器の周囲のサンプルを削除することで、通常のモデル精度に悪影響を与えずにバックドア性能を効果的に緩和できるか?
  • RQ5実世界の金融デリバティブ価格設定シナリオにおいて、ベースラインモデルと比較して防御はどの程度の性能を示すか?

主な発見

  • 防御による再訓練後、元の汚染済みモデルと比較して攻撃の平均二乗誤差(MSE)が50%削減された。
  • 防御により攻撃MSEは約50%削減されたが、クリーンデータにおけるテストMSEおよびテストMAEは維持またはわずかに向上した。
  • バックドア領域に存在する6つの局所誤差最大化器は、それぞれ1,000個以上の近接訓練サンプルを有しており、誤差の98.5百分位数、近接性の99.9百分位数に位置していた。
  • 近接訓練サンプルの偽陽性率は低く(0.012%)、汚染領域を特定する際の特異性が非常に高かった。
  • 防御はバックドア領域から1,823個の誤分類されたサンプルを効果的に削除したが、クリーンデータにおけるモデル性能は保持された。
  • 本手法は、訓練サンプルの近接性の代わりに密度モデルを用いる場合でも有効であり、ハイパーパrameterへの依存性が低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。