[論文レビュー] PatchCleanser: Certifiably Robust Defense against Adversarial Patches for Any Image Classifier
PatchCleanser は、予測の断念を伴わずに adversarial patch を無効化する二段階のピクセルマスキング技術を用いる、証明可能に頑健な防御法であり、あらゆる画像分類器と互換性がある。ImageNet において、83.9% のトップ-1 クリーン精度と 62.1% のトップ-1 証明可能頑健精度を達成し、最先端の性能を発揮する。
The adversarial patch attack against image classification models aims to inject adversarially crafted pixels within a restricted image region (i.e., a patch) for inducing model misclassification. This attack can be realized in the physical world by printing and attaching the patch to the victim object; thus, it imposes a real-world threat to computer vision systems. To counter this threat, we design PatchCleanser as a certifiably robust defense against adversarial patches. In PatchCleanser, we perform two rounds of pixel masking on the input image to neutralize the effect of the adversarial patch. This image-space operation makes PatchCleanser compatible with any state-of-the-art image classifier for achieving high accuracy. Furthermore, we can prove that PatchCleanser will always predict the correct class labels on certain images against any adaptive white-box attacker within our threat model, achieving certified robustness. We extensively evaluate PatchCleanser on the ImageNet, ImageNette, CIFAR-10, CIFAR-100, SVHN, and Flowers-102 datasets and demonstrate that our defense achieves similar clean accuracy as state-of-the-art classification models and also significantly improves certified robustness from prior works. Remarkably, PatchCleanser achieves 83.9% top-1 clean accuracy and 62.1% top-1 certified robust accuracy against a 2%-pixel square patch anywhere on the image for the 1000-class ImageNet dataset.
研究の動機と目的
- 高精度で最先端の画像分類器と互換性を持つ、証明可能に頑健な防御の欠如に取り組むこと。
- 受容 field が小さいことに依存する従来の防御の制限を克服すること、これによりクリーン精度が制限される。
- モデル固有のアーキテクチャ的仮定を必要とせず、強力な頑健性保証を維持すること。
- 予測の断念を避け、安全が重要な応用分野での機能を保証する防御を提供すること。
- 物理世界の patch 攻撃という脅威モデルにおいて、適応的 white-box 攻撃者に対しても高い証明可能頑健性を達成すること。
提案手法
- PatchCleanser は、画像のすべての可能な位置にマスクを配置することで、最初の段階のマスキングを実行し、マスクを施した入力を生成する。
- 各マスク付き画像に対する分類器の予測を評価し、すべての一つのマスク付き予測のうちの多数予測を特定する。
- 多数予測と一致しない予測(不一致予測)に対しては、追加のマスクを用いて二段階目のマスキングを実行し、二重マスク付き入力を生成する。
- すべての二重マスク付き予測が、一つのマスク付き不一致予測と一致する場合、そのラベルが最終予測として出力される。
- 悪意ある予測が存在する場合(すなわち、patch をマスクでカバーする場合)、その予測が回復され、正しく予測されることが保証される。
- 二重マスキングプロセスにより、モデルの再訓練やアーキテクチャ的制約なしに頑健性の証明が可能になる。
実験結果
リサーチクエスチョン
- RQ1ベース分類器のアーキテクチャ的変更を要せず、adversarial patch に対して証明可能に頑健な防御を設計することは可能か?
- RQ2このような防御は、高いクリーン精度を維持しながら、強力な証明可能頑健性を達成できるか?
- RQ3証明可能に頑健な防御において予測の断念を回避することは可能か? これにより、実世界のシステムにおける継続的運用が保証されるか?
- RQ4攻撃者が patch の位置を把握しておらず、かつ適応的である場合、adversarial patch を信頼性高く無効化する方法は何か?
- RQ5攻撃者が防御機構を把握している white-box 脅威モデルにおいても、防御は頑健性保証を維持できるか?
主な発見
- PatchCleanser は ImageNet で 83.9% のトップ-1 クリーン精度を達成し、未防御の最先端モデルと同等の性能を発揮する。
- 画像の任意の場所に 2%-ピクセルの正方形 patch を配置した場合、62.1% のトップ-1 証明可能頑健精度を達成する。
- この防御は、アーキテクチャ的制約なしに高いクリーン精度と高い証明可能頑健精度を両立させる最初の手法である。
- PatchCleanser は、受容 field が小さいことに依存する従来の証明可能頑健防御を上回り、ImageNet では精度が約 55% に制限される。
- この手法により、予測の断念なしに頑健な予測が可能となり、予測の継続性が不可欠な自律システムに適している。
- 二重マスキング機構により、攻撃者が知的にかつ適応的に patch を配置しても、正しく予測を回復することができる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。