Skip to main content
QUICK REVIEW

[論文レビュー] Can we achieve robustness from data alone?

Nikolaos Tsilivis, Jingtong Su|arXiv (Cornell University)|Jul 24, 2022
Adversarial Robustness in Machine Learning被引用数 9
ひとこと要約

この論文は、ニューラル接線カーネル(NTK)を用いたカーネル回帰を通じて、勾配ベースの攻撃に対して耐性を持つモデルを標準的な学習で得られるように、訓練データを最適化するメタラーニング手法adv-KIPを提案する。PGD攻撃に対して高い耐性を示すが、勾配の遮断と過信による誤った耐性の錯覚により、AutoAttackに対しては失敗する。

ABSTRACT

We introduce a meta-learning algorithm for adversarially robust classification. The proposed method tries to be as model agnostic as possible and optimizes a dataset prior to its deployment in a machine learning system, aiming to effectively erase its non-robust features. Once the dataset has been created, in principle no specialized algorithm (besides standard gradient descent) is needed to train a robust model. We formulate the data optimization procedure as a bi-level optimization problem on kernel regression, with a class of kernels that describe infinitely wide neural nets (Neural Tangent Kernels). We present extensive experiments on standard computer vision benchmarks using a variety of different models, demonstrating the effectiveness of our method, while also pointing out its current shortcomings. In parallel, we revisit prior work that also focused on the problem of data optimization for robust classification \citep{Ily+19}, and show that being robust to adversarial attacks after standard (gradient descent) training on a suitable dataset is more challenging than previously thought.

研究の動機と目的

  • 敵対的耐性が特別な学習アルゴリズムを用いずに、単にデータ最適化によって達成可能かどうかを調査すること。
  • モデルに依存しない手法を構築し、データセットを事前処理して非耐性特徴を除去し、耐性のある一般化を向上させること。
  • 最適化されたデータ上で標準的な学習を実行することで、敵対的訓練と同等の耐性を持つモデルが得られるかどうかを評価すること。
  • データ最適化モデルが一部の攻撃に対しては耐性を示すが、特に適応的攻撃に対しては失敗する理由を解明すること。

提案手法

  • 無限に広いニューラルネットワークをモデル化するニューラル接線カーネル(NTK)を用いて、データ最適化を二段階最適化問題として定式化する。
  • メタ最適化フレームワークを用い、敵対的摂動下でのロスを最小化するように繰り返し訓練データを調整する。
  • 勾配ベースのアプローチを用いて、モデルが勾配ベースの攻撃に対して高い耐性を示すようにデータセットを最適化する。
  • カーネル誘導点(KIP)フレームワークを基盤とし、敵対的訓練の信号を用いてそれを敵対的耐性に拡張する。
  • MNIST、CIFAR-10などの標準ベンチマークに、さまざまなカーネルタイプと摂動集合(ε = 0.3、PGDステップ数 = 10)を適用する。
  • 勾配ノルム、信頼度ヒストグラム、損失分解を用いてモデルの挙動を分析し、失敗モードを診断する。

実験結果

リサーチクエスチョン

  • RQ1敵対的耐性は、学習アルゴリズムを変更せずに、単にデータ最適化によって達成可能か?
  • RQ2最適化されたデータセット上で標準的な学習を実行することで、勾配ベースの敵対的攻撃に対して耐性を持つモデルが得られるか?
  • RQ3PGD攻撃に対して高い耐性を示すにもかかわらず、データ最適化モデルが適応的攻撃(例:AutoAttack)に対して失敗する理由は何か?
  • RQ4勾配の遮断や過信といった、データ最適化モデルの背後にある失敗メカニズムは何か?
  • RQ5標準的な敵対的訓練で得られるモデルと比較して、データ最適化モデルの特性はどのように異なるか?

主な発見

  • MNISTでは、adv-KIPにより、耐性精度を0.07%から42.94%まで向上させつつ、クリーン精度を97.67%に維持した。
  • CIFAR-10では、adv-KIPで最適化されたデータ上で学習したモデルはPGD攻撃に対して高い耐性を示したが、AutoAttackに対しては完全に失敗した。
  • 正しく分類された例において勾配が消える現象が観察され、脆弱な耐性の特徴である勾配の遮断を示した。
  • adv-KIPおよびRFDの両データセットにおいて、誤分類された例で勾配ノルムが爆発する現象が観察され、学習ダイナミクスの悪化を示唆した。
  • 最適化されたデータ上で学習したモデルは非常に過信的で、信頼度が不正確であったが、敵対的訓練で得られたモデルとは異なり、信頼度のバランスが取れていた。
  • 本研究は、勾配ベースの最適化によるデータベースの耐性が、適応的攻撃への一般化に失敗する可能性を示し、誤った安心感を生む可能性があることを明らかにした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。