[論文レビュー] Black-box Smoothing: A Provable Defense for Pretrained Classifiers.
この論文では、ブラックボックススムージングを紹介する。これは、カスタムで訓練されたノイズ除去器とランダム化スムージングを適用することで、任意の事前学習済み画像分類器の $ε$- adversarial 攻撃に対する $τ_p$-ノルムにおける耐性を向上させる、証明可能防御手法である。この手法は、元の分類器を変更せずに、たとえクエリアクセスのみの状況でも、ロバスト性を保証する。さらに、Azure、Google、AWS、ClarifAI の主要なクラウドAPIに対しても、ImageNetおよびCIFAR-10で効果的に防御を実現している。
We present a method for provably defending any pretrained image classifier against $\ell_p$ adversarial attacks. By prepending a custom-trained denoiser to any off-the-shelf image classifier and using randomized smoothing, we effectively create a new classifier that is guaranteed to be $\ell_p$-robust to adversarial examples, without modifying the pretrained classifier. The approach applies both to the case where we have full access to the pretrained classifier as well as the case where we only have query access. We refer to this defense as black-box smoothing, and we demonstrate its effectiveness through extensive experimentation on ImageNet and CIFAR-10. Finally, we use our method to provably defend the Azure, Google, AWS, and ClarifAI image classification APIs. Our code replicating all the experiments in the paper can be found at this https URL .
研究の動機と目的
- 事前学習済み画像分類器のモデルを変更せずに、$τ_p$-ノルムにおける $ε$- adversarial 攻撃に対して証明可能なロバスト性を確保する防御手法の開発。
- モデルの完全なアクセスが不可能な状況でも、クエリアクセスのみでロバスト性を実現すること。
- Azure、Google、AWS、ClarifAI などの実世界のAPIに対して、この手法の有効性を示すこと。
- ノイズ除去器を用いたスムージング機構により、ロバスト性を確保しながら高い精度を維持すること。
提案手法
- 事前学習済み分類器の入力前に、カスタムで訓練されたノイズ除去器を追加し、分類の前に入力を変換する。
- ノイズ除去器の出力に対してランダム化スムージングを適用し、$τ_p$-ロバスト性が保証される新たな分類器を生成する。
- モデルの完全なアクセスとクエリのみのアクセスの両方で動作可能であり、ブラックボックス適用を可能にする。
- ノイズ除去器は、スムージング分布下での期待されるロバスト性誤差を最小化するように訓練される。
- 最終的な分類器の予測は、複数のノイズ付き入力の多数決に基づき、スムージング分布から導かれる信頼区間を用いる。
- 実世界のAPIにエンドツーエンドで適用し、実用的導入の有効性を示している。
実験結果
リサーチクエスチョン
- RQ1モデルを変更せずに、任意の事前学習済み画像分類器に対して $τ_p$-ノルムにおける証明可能な $τ_p$-ロバスト性を保証できる防御が構築可能か?
- RQ2モデルの完全なアクセスがなく、クエリアクセスのみの状況でも、この防御はどの程度有効か?
- RQ3Azure や Google などの実世界のクラウドベースの画像分類APIに対しても、この手法は実際に適用可能か?
- RQ4ブラックボックススムージングの文脈において、ロバスト性と通常の精度のトレードオフはどのように変化するか?
- RQ5ImageNet や CIFAR-10 といった多様なデータセットにおいて、この防御の性能はどのようにスケーリングするか?
主な発見
- この手法は、アーキテクチャや学習データに関係なく、任意の事前学習済み分類器に対して証明可能な $τ_p$-ロバスト性を達成する。
- 標準的な精度を高い水準に維持しながら、$τ_p$-ノルムの摂動に対してロバスト性の保証を提供する。
- Azure、Google、AWS、ClarifAI の画像分類APIは、このアプローチにより、 adversarial 攻撃に対して効果的に防御された。
- モデルの完全なアクセスとクエリのみのアクセスの両方で効果的に動作し、ブラックボックス適用の有効性が裏付けられた。
- ImageNet および CIFAR-10 における広範な実験により、多様な設定においてロバスト性と実用性の両方が検証された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。