Skip to main content
QUICK REVIEW

[論文レビュー] Evaluating the Robustness of Geometry-Aware Instance-Reweighted Adversarial Training

Dorjan Hitaj, Giulio Pagnotta|arXiv (Cornell University)|Mar 2, 2021
Adversarial Robustness in Machine Learning参考文献 7被引用数 7
ひとこと要約

この論文は、幾何的特徴を考慮したインスタンス再重み付け adversarial training (GAIRAT) を評価している。GAIRAT は、adversarial なロバストネス推定に基づいてインスタンス依存の損失重みを割り当てる最近の防御手法である。標準攻撃下での CIFAR-10 における精度が最先端を記録しているが、logit スケーリング攻撃に対しては極めて脆弱であり、PGD-20 ではロバスト精度が 53.76% から 43.89% に、PGD+ では 50.32% から 43.27% に低下する。これは、ロバストネスに深刻な欠陥があり、誤った安心感をもたらすことを示している。

ABSTRACT

In this technical report, we evaluate the adversarial robustness of a very recent method called "Geometry-aware Instance-reweighted Adversarial Training"[7]. GAIRAT reports state-of-the-art results on defenses to adversarial attacks on the CIFAR-10 dataset. In fact, we find that a network trained with this method, while showing an improvement over regular adversarial training (AT), is biasing the model towards certain samples by re-scaling the loss. Indeed, this leads the model to be susceptible to attacks that scale the logits. The original model shows an accuracy of 59% under AutoAttack - when trained with additional data with pseudo-labels. We provide an analysis that shows the opposite. In particular, we craft a PGD attack multiplying the logits by a positive scalar that decreases the GAIRAT accuracy from from 55% to 44%, when trained solely on CIFAR-10. In this report, we rigorously evaluate the model and provide insights into the reasons behind the vulnerability of GAIRAT to this adversarial attack. The code to reproduce our evaluation is made available at https://github.com/giuxhub/GAIRAT-LSA

研究の動機と目的

  • GAIRAT、最近提案された adversarial 防御手法であり、クラス境界への幾何的近接度に基づいて adversarial 例の重みを再調整する方法のロバストネスを厳密に評価すること。
  • GAIRAT のインスタンス再重み付けメカニズムが、標準の adversarial 攻撃では顕在しない隠れた脆弱性を引き起こすかどうかを調査すること。
  • GAIRAT に見られる勾配マスキング効果が、予測を変更せずにモデルのロジットの大きさを変更する logit スケーリング攻撃によってどのように露呈されるかを評価すること。
  • PGD-20、PGD+、およびロジットスケーリング付き PGD のさまざまな攻撃設定下での GAIRAT のパフォーマンスを比較し、そのロバストネスにおける弱みを特定すること。

提案手法

  • GAIRAT は、自然なデータポイントが意思決定境界からどれほど離れているかを、そのポイントから adversarial 例を生成するために必要な PGD イテレーションの最小数 κ を用いて幾何的距離を推定する。
  • 境界に近い(ロバスト性が低い)データポイントに対しては高い損失重みを、遠く離れている(よりロバストな)データポイントに対しては低い重みを、関数 ω(x, y, κ) を用いて交差エントロピー損失を調整する。
  • 各訓練サンプルの推定されたロバストネスに基づいて損失をスケーリングすることで、再重み付けされた adversarial リスクを最小化するように深層ニューラルネットワークを訓練する。
  • 研究者たちは、モデルのロジットにスカラー α を乗算することで logit スケーリング攻撃を適用し、勾配の流れを効果的に変更することで、勾配マスキングを露呈する。
  • 複数の脅威モデルを用いて評価する:PGD-20、PGD+、およびロジットスケーリング付き PGD(α = 10)。40 イテレーション、ステップサイズ λ = 0.01、5 回のランダムリスタートを用いる。
  • 評価は、CIFAR-10 の訓練分割のみで訓練された WRN-32-10 モデルを対象とし、標準的および変更された攻撃設定下でのロバスト精度を報告する。

実験結果

リサーチクエスチョン

  • RQ1logit スケーリング攻撃は、adversarial 防御における勾配マスキングを露呈できるが、GAIRAT はこの攻撃下でもロバストネスを維持できるか?
  • RQ2標準の PGD 攻撃下では高いパフォーマンスを示すにもかかわらず、なぜ GAIRAT のロバスト精度が logit スケーリング下で著しく低下するのか?
  • RQ3GAIRAT のインスタンス再重み付けメカニズムが、単純な入力変換に対して脆弱になるほど勾配マスキングを引き起こす程度はどの程度か?
  • RQ4標準的および変更された PGD 攻撃下での GAIRAT のパフォーマンスを、標準的な adversarial training (AT) およびフレンドリーな adversarial training (FAT) と比較すると、どうなるか?
  • RQ5さまざまなロジットスケーリング係数に対して、GAIRAT の最悪ケースのロバスト精度を特定できるか?実験で観察されたように、α = 10 で最も悪い性能が現れるのか?

主な発見

  • ロジットを α = 10 でスケーリングした状態で PGD-20 を適用すると、GAIRAT のロバスト精度は 53.76% から 43.89% に低下し、この単純な攻撃に対して顕著な脆弱性を示している。
  • PGD+ の設定でも、α = 10 の場合、ロバスト精度は 50.32% から 43.27% に低下し、より強力な攻撃設定下でも脆弱性が継続していることが示された。
  • GAIRAT の最悪ケースのロバスト精度は α = 10 で発生するが、標準的な AT や FAT の最悪ケースは α = 1 で発生するため、モデルの感受性に根本的な違いがある。
  • ロジットスケーリング攻撃により、GAIRAT が勾配マスキングを示していることが明らかになった。標準攻撃下では高いパフォーマンスを示すが、この入力変換下ではロバストネスが著しく低下する。
  • ロジットスケーリング下での性能低下は、攻撃自体の失敗によるものではなく、モデルが特定の勾配の大きさに依存しているため、スケーリングによってその大きさが変化するためである。
  • 結果から、GAIRAT は特にロジットスケーリングに感受性が高いことから、AutoAttack に対しても脆弱である可能性が示唆され、現在のロバストネス評価プロトコルの信頼性に懸念が生じる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。