Skip to main content
QUICK REVIEW

[論文レビュー] PoisonedEncoder: Poisoning the Unlabeled Pre-training Data in Contrastive Learning

Hongbin Liu, Jinyuan Jia|arXiv (Cornell University)|May 13, 2022
Adversarial Robustness in Machine Learning被引用数 4
ひとこと要約

PoisonedEncoder は、ターゲットクラスの参照画像と組み合わせた敵対的入力を用いて、ラベルなし事前学習データを汚染することで、単モodalな対照的学習に対する標的型データ汚染攻撃を初めて実現した。攻撃は、攻撃者が選択した入力をターゲットクラスとして誤分類させる高い成功率を達成する一方で、クリーンな入力に対するエンコーダの有用性を維持する。

ABSTRACT

Contrastive learning pre-trains an image encoder using a large amount of unlabeled data such that the image encoder can be used as a general-purpose feature extractor for various downstream tasks. In this work, we propose PoisonedEncoder, a data poisoning attack to contrastive learning. In particular, an attacker injects carefully crafted poisoning inputs into the unlabeled pre-training data, such that the downstream classifiers built based on the poisoned encoder for multiple target downstream tasks simultaneously classify attacker-chosen, arbitrary clean inputs as attacker-chosen, arbitrary classes. We formulate our data poisoning attack as a bilevel optimization problem, whose solution is the set of poisoning inputs; and we propose a contrastive-learning-tailored method to approximately solve it. Our evaluation on multiple datasets shows that PoisonedEncoder achieves high attack success rates while maintaining the testing accuracy of the downstream classifiers built upon the poisoned encoder for non-attacker-chosen inputs. We also evaluate five defenses against PoisonedEncoder, including one pre-processing, three in-processing, and one post-processing defenses. Our results show that these defenses can decrease the attack success rate of PoisonedEncoder, but they also sacrifice the utility of the encoder or require a large clean pre-training dataset.

研究の動機と目的

  • ラベルなし事前学習データの操作により、単モダリティ対照的学習の標的型データ汚染攻撃に対する脆弱性を解消すること。
  • 攻撃者が複数の下流分類器に対して、任意のクリーンな入力を攻撃者が選択したターゲットクラスとして誤分類させる手法を開発すること。
  • 対照的学習の自己教師付き目的に適合したバイレベル最適化問題として攻撃を定式化すること。
  • 下流学習データがクリーンで改ざん不可能な現実的な脅威モデル下での PoisonedEncoder の有効性を評価すること。
  • 既存の防御策がこの新しい攻撃に対してどれほど効果的であるかを評価し、その有用性やデータ要件における限界を同定すること。

提案手法

  • バイレベル最適化問題としてデータ汚染攻撃を定式化する:外側の問題は汚染されたエンコーダ上の攻撃目的を定義し、内側の問題は汚染された事前学習データ上でエンコーダが訓練されるプロセスをモデル化する。
  • 対照的学習に特化した近似手法を提案する。これは、同じ画像のクロップされたビュー同士が類似した特徴を学習することを促進するという事実を活用する。
  • ターゲット入力とターゲットクラスからの参照画像を水平または垂直に連結することで汚染入力を構築する。これにより、ランダムクロップがターゲット入力と参照画像の両方を抽出できるようにする。
  • 対照的学習のランダムクロッピングメカニズムを活用する:汚染入力の2つのクロップされたビューがターゲット入力と参照画像に対応する場合、エンコーダはそれらを類似した特徴で埋め込むよう学習する。
  • 得られたエンコーダを用いて下流分類器を訓練し、汚染によって誘発された特徴の類似性により、ターゲット入力がターゲットクラスとして誤分類されるようにする。
  • トリガを埋め込んだ補助入力と参照画像を連結して汚染入力を生成することで、バックドア攻撃への拡張を実現する。これにより、トリガが検出された場合にのみターゲットクラスに誤分類されるようにする。

実験結果

リサーチクエスチョン

  • RQ1攻撃者が下流学習データを改ざんせずに、ラベルなし事前学習データのみを汚染することで、複数の下流分類器を対照的学習で標的クラスに誤分類させることは可能か?
  • RQ2PoisonedEncoder は、クリーンな入力に対する事前学習エンコーダの性能を維持しつつ、高い攻撃成功率を達成できるか?
  • RQ3既存の防御策(前処理、プロセス内処理、後処理)は PoisonedEncoder に対してどれほど効果を示すか。また、それらの防御には、有用性やデータ要件の面でどのようなトレードオフがあるか?
  • RQ4提案された攻撃は、トリガを埋め込んだ入力がターゲットクラスに誤分類されるバックドア型汚染に拡張可能か?
  • RQ5現在の防御策には、モデルの有用性を損なわせることなく、または大量のクリーンな事前学習データを必要とせずに、耐性を提供する限界があるか?

主な発見

  • PoisonedEncoder は高い攻撃成功率を達成しており、STL10 でのバックドア拡張実験では、トリガを埋め込んだ入力の 96.54% がターゲットクラスとして誤分類された。
  • 攻撃はターゲットでない入力のテスト精度を高く維持しており、汚染されたエンコーダが健全な入力に対して有用性を保っていることを示している。
  • 前処理から後処理までの5つの防御策が評価されたが、いずれも攻撃成功率を低下させたが、エンコーダの有用性を犠牲にしたり、大量のクリーンな事前学習データセットを必要とした。
  • 対照的学習にバギングを拡張することで、認証可能な耐性が得られるが、モデルの有用性が著しく低下するため、耐性と性能の間には強いトレードオフがあることが示された。
  • プロセス内防御策(例:早期停止、ランダムクロッピングの無効化)は攻撃成功率を低下させるが、エンコーダの一般化性能も劣化させる。
  • 微調整を含む後処理防御策は攻撃成功率を低下させられるが、クリーンな事前学習データセットへのアクセスを必要とし、実用的でない可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。