[論文レビュー] Certifying Confidence via Randomized Smoothing
本稿では、ベース分類器の信頼度スコアの分布を活用することで、二値投票に依存せず、確率的スムージング分類器における予測信頼度を証明する手法を提案する。ソフトマックスの信頼度スコアを組み込んだネイマン=ピアソン補題の応用により、信頼度閾値に対するよりきつい認証半径が得られ、CIFAR-10およびImageNetにおいて、単純な境界値よりも顕著に高い耐性保証が達成される。
Randomized smoothing has been shown to provide good certified-robustness guarantees for high-dimensional classification problems. It uses the probabilities of predicting the top two most-likely classes around an input point under a smoothing distribution to generate a certified radius for a classifier's prediction. However, most smoothing methods do not give us any information about the confidence with which the underlying classifier (e.g., deep neural network) makes a prediction. In this work, we propose a method to generate certified radii for the prediction confidence of the smoothed classifier. We consider two notions for quantifying confidence: average prediction score of a class and the margin by which the average prediction score of one class exceeds that of another. We modify the Neyman-Pearson lemma (a key theorem in randomized smoothing) to design a procedure for computing the certified radius where the confidence is guaranteed to stay above a certain threshold. Our experimental results on CIFAR-10 and ImageNet datasets show that using information about the distribution of the confidence scores allows us to achieve a significantly better certified radius than ignoring it. Thus, we demonstrate that extra information about the base classifier at the input point can help improve certified guarantees for the smoothed classifier. Code for the experiments is available at https://github.com/aounon/cdf-smoothing.
研究の動機と目的
- 標準的な確率的スムージングでは予測の確信度情報が欠落していること、すなわち、単にラベルを認証するのみで、予測の確実性を定量化していないという問題に対処すること。
- 滑らか化された分類器の信頼度スコアを、予測ラベルそのものではなく、認証する手法を開発すること。
- ベース分類器からの信頼度スコアの分布を活用することで、すべての投票を同等に扱うのではなく、認証耐性を向上させること。
- 信頼度スコアの分布を組み込むことで、単純な境界値よりも顕著に優れた認証半径が得られることを示すこと。
提案手法
- 二値投票の代わりに、入力周辺のガウスノイズによるパラメータ変動に対して、ソフトマックスの信頼度スコアを平均化する。
- 信頼度スコアの累積分布関数(CDF)を用いて、敵対的摂動下での予測クラスの期待信頼度スコアの下界を導出する。
- 投票数ではなく連続的な信頼度値を考慮するように、ネイマン=ピアソン補題を拡張して、境界を構築する。
- 二分探索アルゴリズムにより、期待信頼度が高い確率でユーザー定義の閾値を超える最大のℓ₂半径を計算する。
- 2つの信頼度指標を用いる:上位クラスの平均予測スコアと、上位クラスと2番目に高いスコアとの差(マージン)。
- 信頼度スコアの分布を完全に活用することで、単純なホーフィング境界値よりもきつい下界が得られることを示す。
実験結果
リサーチクエスチョン
- RQ1滑らか化分類器において、予測ラベルを超えて信頼度スコアを認証することは可能か?
- RQ2信頼度スコアの分布を組み込むことで、標準的な確率的スムージングよりも強い認証耐性保証が得られるか?
- RQ3CDFに基づく境界値は、信頼度分布を無視する単純な境界値と比較して、どのように性能を発揮するか?
- RQ4信頼度認証付きスムージングは、CIFAR-10やImageNetのような実世界のデータセットにおいて、認証精度を向上させることができるか?
主な発見
- CDFベースの手法は、CIFAR-10およびImageNetの両方で、複数の信頼度閾値において、単純な境界値よりも顕著に高い認証精度を達成する。
- σ=0.25のCIFAR-10において、半径0.25の条件下で、CDFベースの手法はベースラインと比較して顕著な認証精度の向上を示す。
- 閾値をゼロに設定した場合、平均予測スコアよりもマージンベースの信頼度指標がやや高い認証精度を達成する。
- 本手法は、ベース分類器の精度が高くても、信頼度スコアの分布に利用可能な情報が存在し、認証耐性を強化できることを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。