Skip to main content
QUICK REVIEW

[論文レビュー] BadEncoder: Backdoor Attacks to Pre-trained Encoders in Self-Supervised Learning

Jinyuan Jia, Yupei Liu|arXiv (Cornell University)|Aug 1, 2021
Adversarial Robustness in Machine Learning被引用数 16
ひとこと要約

BadEncoder は自己教師あり学習における事前学習済み画像エンコーダーを標的とした最初のバックドア攻撃であり、勾配ベースの最適化を用いてトリガーをエンコーダーに直接埋め込む。高い攻撃成功率を達成するとともに、下流分類器の精度を維持し、最先端の実証的および証明可能な防御を回避する。これは自己教師ありAIパイプラインにおける重要なセキュリティ的欠陥を露呈する。

ABSTRACT

Self-supervised learning in computer vision aims to pre-train an image encoder using a large amount of unlabeled images or (image, text) pairs. The pre-trained image encoder can then be used as a feature extractor to build downstream classifiers for many downstream tasks with a small amount of or no labeled training data. In this work, we propose BadEncoder, the first backdoor attack to self-supervised learning. In particular, our BadEncoder injects backdoors into a pre-trained image encoder such that the downstream classifiers built based on the backdoored image encoder for different downstream tasks simultaneously inherit the backdoor behavior. We formulate our BadEncoder as an optimization problem and we propose a gradient descent based method to solve it, which produces a backdoored image encoder from a clean one. Our extensive empirical evaluation results on multiple datasets show that our BadEncoder achieves high attack success rates while preserving the accuracy of the downstream classifiers. We also show the effectiveness of BadEncoder using two publicly available, real-world image encoders, i.e., Google's image encoder pre-trained on ImageNet and OpenAI's Contrastive Language-Image Pre-training (CLIP) image encoder pre-trained on 400 million (image, text) pairs collected from the Internet. Moreover, we consider defenses including Neural Cleanse and MNTD (empirical defenses) as well as PatchGuard (a provable defense). Our results show that these defenses are insufficient to defend against BadEncoder, highlighting the needs for new defenses against our BadEncoder. Our code is publicly available at: https://github.com/jjy1994/BadEncoder.

研究の動機と目的

  • 自己教師あり学習パイプラインにおけるセキュリティ研究の不足、特にバックドア脅威に対する対策を補うこと。
  • 下流分類器の学習段階ではなく、事前学習済みエンコーダー段階を標的にする新しいバックドア攻撃を開発すること。
  • 汚染された入力に対して一貫して誤分類を行う一方で、クリーンな入力に対しては高い精度を維持するバックドアが施された下流分類器の性能を保証すること。
  • CLIP や ImageNet ベースのモデルなど、実世界で公開済みの事前学習済みエンコーダーを用いて、BadEncoder の有効性を評価すること。
  • 既存の防御(実証的および証明可能)が、この新しい攻撃表面に対してどれほど耐性を示すかをテストすること。

提案手法

  • クリーンな入力の精度を維持しつつ、トリガーを埋め込んだ入力に対する損失を最小化する最適化問題として、事前学習済みエンコーダーへのバックドア埋め込みを定式化する。
  • 勾配降下法を用いてエンコーダーのパラメータを更新し、攻撃者定義の条件下で誤分類を引き起こすトリガーを埋め込む。
  • ターゲットクラスのリファレンス画像と、事前学習データとは異なる可能性のあるシャドウデータセットを用いて最適化をガイドする。
  • 特定のトリガーが埋め込まれた任意の入力が、ターゲットクラスとして分類されるようにバックドアを注入する。これは下流タスクに依存しない。
  • クリーンな入力に対する精度を高い水準に保つことで、攻撃の隠密性を確保する。これはターゲットおよび非ターゲットの下流タスクの両方で成立する。
  • 複数のターゲットクラスおよび下流タスクを同時に攻撃する。各 (タスク, クラス) 組み合わせに対して固有のトリガーを用いる。
Figure 1: Overview of BadEncoder.
Figure 1: Overview of BadEncoder.

実験結果

リサーチクエスチョン

  • RQ1自己教師あり学習における事前学習済み画像エンコーダーに対して、バックドア攻撃を効果的に実行可能であり、下流分類器の学習段階を侵害する必要がないか?
  • RQ2BadEncoder は、高い攻撃成功率を達成しつつ、クリーンな入力に対する下流分類器の有用性をどの程度維持できるか?
  • RQ3Neural Cleanse や MNTD といった最先端の実証的防御は、分類器ではなくエンコーダーを標的にするバックドア攻撃に対してどれほど有効か?
  • RQ4PatchGuard といった証明可能な防御は、エンコーダー段階のバックドア攻撃に対して十分な耐性を示せるか?
  • RQ5このような攻撃が、CLIP や ImageNet ベースのエンコーダーといった実世界の生産用自己教師ありモデルに与える影響は何か?

主な発見

  • BadEncoder は複数のデータセットで 95% を超える高い攻撃成功率を達成した一方で、ターゲットおよび非ターゲットの下流タスクにおいてもクリーンな入力の精度が 90% を超える水準を維持した。
  • 攻撃は、ゼロまたは最小限のラベル付きデータで学習された下流分類器に対しても、バックドアの挙動を効果的に伝搬した。
  • Neural Cleanse や MNTD といった最先端の実証的防御は、エンコーダー内のバックドアを検出できず、エンコーダー段階の攻撃に対してその限界が明らかになった。
  • 証明可能な防御である PatchGuard は、BadEncoder の攻撃に対して十分な耐性保証を提供できず、現在の認証防御がこの脅威表面に対しては効果的でないことが示唆された。
  • 攻撃は実世界の事前学習済みエンコーダー(Google の ImageNet エンコーダーや OpenAI の CLIP を含む)に対しても有効であり、実用的妥当性と実世界への影響を実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。