[論文レビュー] Second-Order Provable Defenses against Adversarial Attacks
本稿では、2次情報(ヘッセ行列固有値の上限)を活用して、$\ell_2$-有界な敵対的攻撃に対して、効率的でタイトなロバスト性証明を計算する、曲率に基づくロバスト性証明(CRC)と曲率に基づくロバストトレーニング(CRT)を提案する。トレーニング中にネットワークの曲率を正則化することにより、CRTは、2層、3層、4層のMNISTネットワークでそれぞれ69.79%、57.78%、53.19%の最先端の認証ロバスト精度を達成し、IBPベースの手法を著しく上回る。
A robustness certificate is the minimum distance of a given input to the decision boundary of the classifier (or its lower bound). For {\it any} input perturbations with a magnitude smaller than the certificate value, the classification output will provably remain unchanged. Exactly computing the robustness certificates for neural networks is difficult since it requires solving a non-convex optimization. In this paper, we provide computationally-efficient robustness certificates for neural networks with differentiable activation functions in two steps. First, we show that if the eigenvalues of the Hessian of the network are bounded, we can compute a robustness certificate in the $l_2$ norm efficiently using convex optimization. Second, we derive a computationally-efficient differentiable upper bound on the curvature of a deep network. We also use the curvature bound as a regularization term during the training of the network to boost its certified robustness. Putting these results together leads to our proposed {\bf C}urvature-based {\bf R}obustness {\bf C}ertificate (CRC) and {\bf C}urvature-based {\bf R}obust {\bf T}raining (CRT). Our numerical results show that CRT leads to significantly higher certified robust accuracy compared to interval-bound propagation (IBP) based training. We achieve certified robust accuracy 69.79\%, 57.78\% and 53.19\% while IBP-based methods achieve 44.96\%, 44.74\% and 44.66\% on 2,3 and 4 layer networks respectively on the MNIST-dataset.
研究の動機と目的
- 1次のリプシッツ境界ではなく、2次情報(曲率)を用いて、$\ell_2$-有界な敵対的攻撃に対して、証明可能なロバスト防御を開発すること。
- ネットワークのヘッセ行列の固有値を制限することにより、最小の$\ell_2$距離から意思決定境界までのタイトで効率的なロバスト性証明を計算すること。
- トレーニング中にネットワークの曲率を低減するための微分可能で曲率に基づく正則化項を設計すること。
- 曲率正則化が、従来の区間境界伝播(IBP)手法よりも顕著に高い認証ロバスト精度をもたらすことを示すこと。
提案手法
- 補題1を用いて、微分可能活性化関数を備えた深層ニューラルネットワークのヘッセ行列の閉形式表現を導出する。
- ヘッセ行列固有値の上限を用いることで、凸最適化を介してロバスト性証明を計算できる理論的条件を確立する。
- 最小の$\ell_2$距離から意思決定境界までのタイトで、効率的に計算可能な下界としての曲率に基づくロバスト性証明(CRC)を提唱する。
- トレーニング中に正則化として使用可能な、曲率(ヘッセ行列固有値)の微分可能な上界を提案する。
- 曲率上限を正則化項として組み込むことで、ネットワークの曲率を最小化しつつ精度を維持する、曲率に基づくロバストトレーニング(CRT)を構築する。
- 双対性理論を用いて、証明と攻撃問題を関連づけ、検証可能な条件下で、証明可能な最も近い敵対的例を効率的に計算可能にする。
実験結果
リサーチクエスチョン
- RQ1ヘッセ行列固有値という2次情報は、IBPのような1次手法よりもタイトで、より効率的なロバスト性証明を導出可能か?
- RQ2深層ネットワークの曲率の微分可能な上界を計算可能であり、トレーニング中に正則化として使用可能か?
- RQ3正則化によるネットワークの曲率の最小化は、標準精度を劣化させることなく、より高い認証ロバスト精度をもたらすか?
- RQ4CRC手法が、与えられた入力に対して、最も近い敵対的例を証明可能に特定できる条件は何か?
- RQ5MNISTおよびFashion-MNISTにおいて、曲率に基づく正則化は、IBPおよび他の敵対的訓練ベースラインと比較して、認証ロバスト性において優れているか?
主な発見
- CRTは、2層、3層、4層のMNISTネットワークで、それぞれ69.79%、57.78%、53.19%の認証ロバスト精度を達成し、IBPベースの手法(それぞれ44.96%、44.74%、44.66%)を著しく上回る。
- 敵対的訓練を実施しなくても、曲率正則化により非自明な認証ロバスト精度が達成可能である:シグモイドネットワークでは2層で84.73%、3層で88.66%、4層で89.61%。
- MNISTの2層、3層、4層ネットワークにおいて、CRC手法はそれぞれ44.17%、22.59%、19.53%のケースで、最も近い敵対的例を証明可能に特定できる。
- 小さな曲率正則化項($\gamma = 0.005$)を追加すると、2層シグモイドネットワークのCRCは約0.48から約0.83に上昇するが、標準精度は0.5%未満に低下する。
- CROWN証明は曲率正則化によってわずかに上昇するが、CRCは顕著に上昇するため、CRCはよりタイトで情報量の多い証明であることが示唆される。
- ReLUおよびシグモイド活性化関数を備えた4層ネットワークでは、敵対的訓練を実施しなくても、曲率正則化により認証ロバスト精度が85%以上に達する。これは、本手法の有効性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。