Skip to main content
QUICK REVIEW

[論文レビュー] Backdooring Convolutional Neural Networks via Targeted Weight Perturbations

Jacob Dumford, Walter J. Scheirer|arXiv (Cornell University)|Dec 7, 2018
Adversarial Robustness in Machine Learning被引用数 12
ひとこと要約

この論文は、訓練済み畳み込みニューラルネットワーク(CNN)に対して、ネットワーク重みを摂動させることで標的のバックドアを埋め込む、新しいバックドア攻撃を提案する。攻撃者は、特定の偽装入力を正当なアイデンティティとして誤って検証できるようにする。この手法は、非標的クラスに対しては元の精度を維持しつつ、標的クラスの偽陽性率を最大75%まで引き上げる。その結果、パフォーマンス監視やファイルハッシュ化による検出は極めて困難になる。

ABSTRACT

We present a new type of backdoor attack that exploits a vulnerability of convolutional neural networks (CNNs) that has been previously unstudied. In particular, we examine the application of facial recognition. Deep learning techniques are at the top of the game for facial recognition, which means they have now been implemented in many production-level systems. Alarmingly, unlike other commercial technologies such as operating systems and network devices, deep learning-based facial recognition algorithms are not presently designed with security requirements or audited for security vulnerabilities before deployment. Given how young the technology is and how abstract many of the internal workings of these algorithms are, neural network-based facial recognition systems are prime targets for security breaches. As more and more of our personal information begins to be guarded by facial recognition (e.g., the iPhone X), exploring the security vulnerabilities of these systems from a penetration testing standpoint is crucial. Along these lines, we describe a general methodology for backdooring CNNs via targeted weight perturbations. Using a five-layer CNN and ResNet-50 as case studies, we show that an attacker is able to significantly increase the chance that inputs they supply will be falsely accepted by a CNN while simultaneously preserving the error rates for legitimate enrolled classes.

研究の動機と目的

  • 訓練データや入力の変更なしに、モデル重みの変更によって事前学習済みCNNにバックドアを埋め込む可能性を調査すること。
  • この攻撃が、トレーニングデータにアクセスできない状況でも、事前学習済みモデルへのアクセスのみでデプロイ後にも実行可能であることを示すこと。
  • 正当な入力の精度を高保ちつつ、標的の偽装入力の誤分類率を著しく引き上げる攻撃の有効性を評価すること。
  • ファイルハッシュ化などの標準的な整合性検証手法で、このようなバックドアを検出するのはどの程度困難であるかを評価すること。
  • この脆弱性が、実世界の顔認識システムやディープラーニングモデルの広範なセキュリティに与える影響を検討すること。

提案手法

  • 攻撃は最適化ルーチンを用いて、特定の偽装入力を標的のアイデンティティとして誤分類する確率を最大化するように、標的の重み摂動を計算する。
  • 訓練データや入力処理を変更せずに、事前学習済みCNN(例:5層CNNやResNet-50)の学習済み重みに直接摂動を適用する。
  • 最適化プロセスは、すべての非標的入力について、元の精度から1.5%以内に収まるように制約される。
  • 攻撃は複数のモデルアーキテクチャと偽装入力-標的ペアで評価され、標的クラスでの偽陽性率が40%以上であることが成功の基準とされる。
  • 検出耐性は、暗号的ハッシュ化や確率的モデル出力のシミュレーションを含む、一般的な整合性チェックを模擬してテストされる。
  • この手法は、モデル重みへのアクセスが可能である前提(従来のキット攻撃と同様のシステム侵害を想定)である。

実験結果

リサーチクエスチョン

  • RQ1訓練データにアクセスできない状況でも、ネットワーク重みの変更のみで事前学習済みCNNにバックドアを成功裏に埋め込めるか?
  • RQ2この攻撃は、正当な入力の精度をどれほど維持しつつも、特定の標的クラスの偽陽性率を著しく引き上げられるか?
  • RQ3ファイルハッシュ化のような標準的な検出手法は、このような重みベースのバックドアをどの程度効果的に特定できるか?
  • RQ4モデルの微調整や確率的推論といった技術によって、この攻撃を回避または緩和できるか?
  • RQ5この攻撃は、デプロイ済み顔認識システムにどのような実用的影響を及えるか?

主な発見

  • 提案された攻撃は、標的の偽装入力の偽陽性率を最大75%まで引き上げた一方で、他のすべての入力について元の精度を1.5%以内に維持した。
  • テストされた反復の15%において、標的クラスでの偽陽性率が40%以上に達し、成功基準を満たした。
  • 5層CNNやResNet-50を含む複数のアーキテクチャで攻撃が有効であったため、広範な適用可能性が示された。
  • ファイルハッシュ化に基づく検出は、確率的重み摂動やバックドアインジェクション時のハッシュ衝突攻撃の可能性により、信頼性が低いことが示された。
  • モデル全体の精度が非標的入力に対して維持されるため、パフォーマンス監視による検出は不可能である。
  • 本研究は、モデルの監査がデプロイ後に行われても、重みの改ざんによる攻撃が依然として検出不能であることを示し、デプロイ済みディープラーニングモデルの脆弱性を浮き彫りにした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。