[論文レビュー] Bayesian Inference with Certifiable Adversarial Robustness
本稿は、入力のε-ボール内での最悪ケースの摂動を考慮するために尤度関数を変更することにより、証明可能な敵対的ロバスト性を持つ深層ニューラルネットワークを訓練するベイジアンフレームワークを導入する。区間境界伝播(IBP)を用いて、ロバスト尤度の証明可能な下界を計算し、MNIST、FashionMNIST、CIFAR-10における最初の証明可能なロバスト性を持つベイジアンニューラルネットワークの訓練を可能にした。MNISTでは最大75%の証明可能なロバスト精度を達成し、不確実性のキャリブレーションが向上した。
We consider adversarial training of deep neural networks through the lens of Bayesian learning, and present a principled framework for adversarial training of Bayesian Neural Networks (BNNs) with certifiable guarantees. We rely on techniques from constraint relaxation of non-convex optimisation problems and modify the standard cross-entropy error model to enforce posterior robustness to worst-case perturbations in $ε$-balls around input points. We illustrate how the resulting framework can be combined with methods commonly employed for approximate inference of BNNs. In an empirical investigation, we demonstrate that the presented approach enables training of certifiably robust models on MNIST, FashionMNIST and CIFAR-10 and can also be beneficial for uncertainty calibration. Our method is the first to directly train certifiable BNNs, thus facilitating their deployment in safety-critical applications.
研究の動機と目的
- 敵対的攻撃に対して証明可能なロバスト性を持つBNNを訓練するための原理的で整合性のあるベイジアン手法の欠如に対処すること。
- 入力のε-ボール内での最悪ケースの摂動に対して事後分布のロバスト性を強制するロバスト尤度モデルの開発。
- HMC、BBB、SWAG、NoisyAdam、VOGNなどの既存の近似推論手法と統合可能な、微分可能な方法で尤度モデルを変更すること。
- 本手法が非自明な証明可能なロバスト性を実現し、標準ベンチマークで不確実性のキャリブレーションが向上することを実証的に検証すること。
- ロバスト訓練がパrameter空間内のよりロバストな領域へとBNN事後分布を押し上げる影響を示すこと。
提案手法
- ユーザーが定義した確率密度関数を用いてε-ボール上でのネットワーク出力を周辺化することで、敵対的ロバスト性に一般化された標準的な交差エントロピーの代わりにロバスト尤度関数を提案する。
- 制約緩和と区間境界伝播(IBP)を用いて、任意のε > 0に対してロバスト尤度の証明可能な下界を計算する。
- HMC、BBB、SWAG、NoisyAdam、VOGNなどの標準的な近似推論手法と統合可能な、微分可能な方法で尤度モデルを変更する。
- ロバスト尤度を用いてBNNを訓練し、敵対的摂動に対して inherently ロバストな事後分布推論を可能にする。
- 訓練および評価中にIBPを適用し、ロバスト精度に関する形式的保証を確保する、証明可能なロバスト性の境界を計算する。
- 標準的な指標(証明可能なロバスト精度、不確実性キャリブレーションのための予測エントロピーなど)を用いて、MNIST、FashionMNIST、CIFAR-10で手法を評価する。
実験結果
リサーチクエスチョン
- RQ1証明可能な敵対的ロバスト性を持つBNNを訓練するための原理的で整合性のあるベイジアンフレームワークを開発できるか?
- RQ2標準的な交差エントロピー尤度は、ε-ボール内での最悪ケースの摂動に対してどのように拡張可能か?
- RQ3区間境界伝播(IBP)を用いて、BNNにおける近似推論のためのロバスト尤度の証明可能な下界を計算できるか?
- RQ4ロバスト尤度を用いたBNNの訓練は、分布外データにおける不確実性キャリブレーションを向上させるか?
- RQ5ロバスト訓練が、さまざまなε値における最大安全半径(すなわちロバスト性)に与える影響は何か?
主な発見
- 提案手法は、ε=0.1のときMNISTで最大75%の証明可能なロバスト精度を達成し、BNNにおける最初の非自明な証明可能なロバスト性を示した。
- FashionMNISTでは、ε=0.1のとき最大73%の証明可能なロバスト精度を達成し、データセット間での強い一般化性能を示した。
- CIFAR-10では、ε=1/255のとき最大50%の証明可能なロバスト精度を達成し、最新の決定的モデルと同等の性能を示した。
- ロバスト尤度を用いて訓練したBNNの最大証明可能な安全半径は、標準尤度で訓練したモデルの約2倍にのぼった。
- ロバスト訓練は不確実性キャリブレーションを顕著に向上させ、MNISTで訓練したモデルがFashionMNIST(分布外)データに対して、CIFAR-10で訓練したモデルがSVHN(分布外)データに対して、エントロピーを上昇させた。
- CIFAR-10では、標準BNNは分布外データに対して分布内データよりも過信しすぎていたが、ロバスト訓練によりこの傾向が逆転し、より良好にキャリブレートされた不確実性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。