Skip to main content
QUICK REVIEW

[論文レビュー] How to Inject Backdoors with Better Consistency: Logit Anchoring on Clean Data

Zhiyuan Zhang, Lingjuan Lyu|arXiv (Cornell University)|Sep 3, 2021
Adversarial Robustness in Machine Learning参考文献 38被引用数 10
ひとこと要約

本稿では、継続的データに対するモデル動作を凍結することで一貫性を向上させる、新しい手法であるログイトアンカリングを提案する。敵対的重み摂動(AWP)がバックドアチューニング中に自然に発生することを理論的・実験的に示し、グローバルおよびインスタンスごとの一貫性を向上させ、BadNetsなどのベースライン手法と比較してログイト分散を顕著に低減する。

ABSTRACT

Since training a large-scale backdoored model from scratch requires a large training dataset, several recent attacks have considered to inject backdoors into a trained clean model without altering model behaviors on the clean data. Previous work finds that backdoors can be injected into a trained clean model with Adversarial Weight Perturbation (AWP). Here AWPs refers to the variations of parameters that are small in backdoor learning. In this work, we observe an interesting phenomenon that the variations of parameters are always AWPs when tuning the trained clean model to inject backdoors. We further provide theoretical analysis to explain this phenomenon. We formulate the behavior of maintaining accuracy on clean data as the consistency of backdoored models, which includes both global consistency and instance-wise consistency. We extensively analyze the effects of AWPs on the consistency of backdoored models. In order to achieve better consistency, we propose a novel anchoring loss to anchor or freeze the model behaviors on the clean data, with a theoretical guarantee. Both the analytical and the empirical results validate the effectiveness of the anchoring loss in improving the consistency, especially the instance-wise consistency.

研究の動機と目的

  • 事前学習モデルにバックドアを注入する際、なぜ敵対的重み摂動(AWP)が自然に発生するのかを理解すること。
  • バックドアが注入されたモデルの一貫性を形式的に定式化し、グローバル一貫性とインスタンスごとの一貫性を区別すること。
  • クリーン精度や攻撃成功確率を劣化させることなく、バックドア注入中にグローバルおよびインスタンスごとの一貫性を向上させる手法を開発すること。
  • ログイトアンカリングがバックドアが注入されたモデルの一貫性をどのように向上させるかの理論的裏付けを提供すること。
  • 限られたデータ設定下で、多様なビジョンおよびNLPベンチマークにおいてログイトアンカリングの有効性を検証すること。

提案手法

  • クリーンデータ上のモデルログイトと元のクリーンモデルのログイトとのL2距離を最小化する新しいアンカリング損失を提案し、クリーン入力に対する動作を効果的に凍結する。
  • バックドアチューニング中に、最適なバックドアパラメータがクリーンモデルのパラメータに近接していることから、AWPが自然に発生することを理論的に分析する。
  • ファインチューニング中にアンカリング損失を適用し、クリーンサンプルにおけるモデル予測の安定性を高め、インスタンス間のログイト分散を低減する。
  • インスタンスごとの一貫性を評価するために、ログイト距離、P距離、KL発散、ピアソン相関係数の複数のメトリクスを用いる。
  • アンカリング損失の強度を制御するハイパーパrameter λ を用い、クリーン精度と一貫性のバランスを取る。
  • 損失盆地とインスタンスごとのログイト一貫性を可視化し、提案手法とBadNetsおよびL2ペナルティベースラインとを比較する。

実験結果

リサーチクエスチョン

  • RQ1なぜ事前学習モデルにバックドアを注入する際、敵対的重み摂動(AWP)が自然に発生するのか?
  • RQ2バックドアが注入されたモデルの一貫性は、特にインスタンスごとの挙動に関して、どのように形式的に定義・測定できるか?
  • RQ3新しいアンカリング損失が、クリーン精度や攻撃成功確率を劣化させることなく、バックドアが注入されたモデルのグローバルおよびインスタンスごとの一貫性を向上させられるか?
  • RQ4L2ペナルティ、PGD、EWCなどの既存手法と比較して、ログイトアンカリングは一貫性およびロバストネスにおいてどのように異なるか?
  • RQ5向上した一貫性は、実世界のシナリオにおいてバックドアの検出困難性をどの程度低減させるか?

主な発見

  • 提案手法のログイトアンカリングは、インスタンスごとの一貫性が顕著に高く、CIFAR-10ではピアソン相関係数が0.859に達し、BadNetsの0.697を上回る。
  • アンカリング手法は、BadNetsと比較してログイト分散を80%低減し、0.48のログイト距離(クリーンモデルの0.00と比較)および0.014のmKL発散(BadNetsの0.110と比較)を示した。
  • CIFAR-100およびTiny-ImageNetでも、640枚の訓練画像のみで高一貫性を維持し、L2ペナルティおよびPGDベースラインを上回った。
  • CIFAR-10では97.28%の攻撃成功率(ASR)と94.41%のクリーン精度を達成し、性能劣化は最小限に抑えられた。
  • 可視化により、アンカリング手法がBadNetsおよびL2ペナルティ付きモデルと比較して、クリーンサンプル全体でより一貫性のあるログイトを生成することが確認された。
  • 理論的分析により、最適なバックドアパラメータがクリーンモデルのパラメータに近接していることから、AWPがバックドアチューニング中に自然に発生することが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。