Skip to main content
QUICK REVIEW

[論文レビュー] An Empirical Evaluation of Adversarial Robustness under Transfer Learning

Todor Davchev, Timos Korres|arXiv (Cornell University)|May 7, 2019
Adversarial Robustness in Machine Learning参考文献 15被引用数 6
ひとこと要約

本稿は、CIFAR-100で訓練されたResNet56からCIFAR-10のターゲットネットワークへの敵対的ロバストネスの転送を、FGSMおよびPGDの敵対的訓練を用いて評価している。PGDベースのロバスト特徴はFGSMよりも効果的に転送され、ターゲットでのロバスト重み初期化と敵対的訓練を組み合わせることで、ホワイトボックスPGD攻撃に対する精度が5.2%向上し、転送可能な防御のための反復的ロバスト最適化の重要性が示された。

ABSTRACT

In this work, we evaluate adversarial robustness in the context of transfer learning from a source trained on CIFAR 100 to a target network trained on CIFAR 10. Specifically, we study the effects of using robust optimisation in the source and target networks. This allows us to identify transfer learning strategies under which adversarial defences are successfully retained, in addition to revealing potential vulnerabilities. We study the extent to which features learnt by a fast gradient sign method (FGSM) and its iterative alternative (PGD) can preserve their defence properties against black and white-box attacks under three different transfer learning strategies. We find that using PGD examples during training on the source task leads to more general robust features that are easier to transfer. Furthermore, under successful transfer, it achieves 5.2% more accuracy against white-box PGD attacks than suitable baselines. Overall, our empirical evaluations give insights on how well adversarial robustness under transfer learning can generalise.

研究の動機と目的

  • CIFAR-100で訓練されたソースモデルの敵対的ロバストネスが、CIFAR-10のターゲットモデルにどの程度転送されるかを調査すること。
  • 敵対的訓練によって学習されたロバスト特徴が、転送学習の下でタスク間で一般化するかを評価すること。
  • ブラックボックスおよびホワイトボックスの敵対的攻撃に対してロバストネスを保持または向上させる転送学習戦略を同定すること。
  • ターゲットネットワークにおけるロバスト重み初期化と敵対的訓練の影響が、防御の一般化性能に与える影響を評価すること。

提案手法

  • 3つの戦略を用いて、CIFAR-100で訓練されたResNet56からCIFAR-10のターゲットネットワークへの転送学習を実施:最終層のみを凍結する、最後のブロックのみを解放する、またはネットワーク全体を微調整する。
  • 敵対的ロバストネスの評価には2つの脅威モデルを用いる:Fast Gradient Sign Method (FGSM) および Projected Gradient Descent (PGD)。PGDは反復的攻撃としてロバスト最適化に使用される。
  • ソースおよびターゲットネットワークの両方で、FGSMおよびPGDによる敵対的例をデータに追加することで、訓練中にロバスト最適化を適用する。
  • ブラックボックスおよびホワイトボックス攻撃設定下でのクリーン精度および敵対的精度を用いて、異なる訓練および転送の組み合わせの性能を評価する。
  • アブレーションスタディでは、ソースおよびターゲットで自然(nat)または敵対的(adv)最適化を用いたモデルを比較し、R_adv→adv のような表記法を用いてソースおよびターゲットの訓練方法を示す。
  • 結果は正規化されたヒートマップおよび包括的な精度表を用いて可視化され、主な比較はロバストネス転送とクリーン精度のトレードオフに集中する。

実験結果

リサーチクエスチョン

  • RQ1FGSMまたはPGDを用いた敵対的訓練によって学習されたロバストネスが、CIFAR-100のソースモデルからCIFAR-10のターゲットモデルに効果的に転送されるか?
  • RQ2敵対的訓練法の選択(FGSM対PGD)が、ロバスト特徴の転送性にどのように影響するか?
  • RQ3ロバスト重み初期化は、特にホワイトボックス攻撃下で防御性能を向上させることができるか?
  • RQ4微調整対特徴抽出などの異なる転送学習戦略が、ロバストネスおよびクリーン精度に与える影響は何か?
  • RQ5低レベル特徴はロバストネス転送にどの程度寄与するか?また、高レベルの分類的特徴と比較して、敵対的防御においてどのように異なるか?

主な発見

  • PGDベースの敵対的訓練により、CIFAR-100のソースネットワークで学習されたロバスト特徴は、FGSMベースの防御よりも一般化性が高く、より効果的に転送される。
  • ソースタスクでの訓練時にPGDの敵対的例を用いることで、ターゲットネットワークにおけるホワイトボックスPGD攻撃に対する精度がベースラインと比較して5.2%向上した。
  • ロバスト重み初期化とターゲットネットワークでの敵対的訓練を組み合わせることで、ホワイトボックス攻撃に対するロバストネスが顕著に向上し、評価された設定で最先端の性能を達成した。
  • 低レベル特徴のみに依存する防御は、ブラックボックス攻撃に対して十分なロバストネスを提供し、高レベルの分類的特徴に依存する防御よりも一貫して高い転送性を示した。
  • 最後のブロックのみを微調整する戦略は、性能と訓練効率の良いトレードオフを実現し、ベースラインに近いロバストネスを達成しながら計算コストを削減した。
  • ロバスト初期化後にターゲットネットワークで非反復的メソッド(例:FGSM)を用いた敵対的訓練を行うと、性能が悪化した。これは、PGDのような反復的攻撃が必要であることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。