Skip to main content
QUICK REVIEW

[論文レビュー] PAC Confidence Predictions for Deep Neural Network Classifiers

Sangdon Park, Shuo Li|arXiv (Cornell University)|Nov 2, 2020
Adversarial Robustness in Machine Learning参考文献 39被引用数 6
ひとこと要約

この論文は、クロッパー=ピアソン境界とヒストグラムビニングを用いて理論的保証付きの信頼区間を提供する、深層ニューラルネットワーク分類器向けのPAC信頼度予測手法を提案する。この手法は、分布内補正を高確率で満たし、高速推論および安全な計画応用における証明可能な保証を可能にし、厳密な誤差およびリスク制約下でも、ベースラインを上回る精度と安全性を維持する。

ABSTRACT

A key challenge for deploying deep neural networks (DNNs) in safety critical settings is the need to provide rigorous ways to quantify their uncertainty. In this paper, we propose a novel algorithm for constructing predicted classification confidences for DNNs that comes with provable correctness guarantees. Our approach uses Clopper-Pearson confidence intervals for the Binomial distribution in conjunction with the histogram binning approach to calibrated prediction. In addition, we demonstrate how our predicted confidences can be used to enable downstream guarantees in two settings: (i) fast DNN inference, where we demonstrate how to compose a fast but inaccurate DNN with an accurate but slow DNN in a rigorous way to improve performance without sacrificing accuracy, and (ii) safe planning, where we guarantee safety when using a DNN to predict whether a given action is safe based on visual observations. In our experiments, we demonstrate that our approach can be used to provide guarantees for state-of-the-art DNNs.

研究の動機と目的

  • 安全性が求められるシステムにおいて過信が一般的であることを踏まえ、深層ニューラルネットワーク(DNN)の信頼度補正に理論的保証が欠如している問題に対処すること。
  • 分布内仮定の下で、おそらく近似的に正しい(PAC)信頼度境界を提供する手法を開発すること。
  • 精度を損なわせることなく、推論速度を向上させるために、高速および遅速DNNの厳密な合成を可能にすること。
  • DNNベースの認識モデルを用いた計画タスクにおいて、高確率での安全保証を確保すること。

提案手法

  • この手法は、DNNの信頼度スコアをヒストグラムビニングでグループ化し、各ビンごとに正しく予測された頻度を用いて補正を実施する。
  • 各ビンの二項割合に対してクロッパー=ピアソン信頼区間を適用し、補正の信頼度の上限および下限を計算する。
  • これらの境界を用いて、テスト分布上で高確率で正しいと証明可能なPAC検証付きの信頼区間を構築する。
  • 本手法は2つの応用に統合されている:(1) 誤差境界が保証された高速および遅速DNNの合成、(2) 信頼度しきい値に基づく行動選択による安全な計画。
  • 補正セットのサイズnを用いて、最終モデルの誤差率がユーザー指定のしきい値ξを高確率(1−δ)で下回ることを保証する。
  • MACs、CPU、GPUの推論時間メトリクスを用いて評価され、ヒストグラムビニング、ソフトマックススケーリング、温度スケーリングのベースラインと比較されている。

実験結果

リサーチクエスチョン

  • RQ1分布内仮定の下で、理論的正しさの保証を伴うDNN分類器の信頼度予測を構築できるか?
  • RQ2PAC信頼区間をヒストグラムビニングと効果的に組み合わせることで、補正され、理論的に正しい信頼度境界を生成できるか?
  • RQ3提案手法により、ユーザー指定のしきい値以下の保証された誤差率を維持しつつ、速度を向上させるコンポジショナル推論戦略を実現できるか?
  • RQ4信頼度しきい値に基づくアクションフィルタリングにより、本手法は計画タスクで高確率での安全保証を確保できるか?

主な発見

  • 提案手法は、すべてのテスト設定において、望ましいしきい値ξ未満の分類誤差を保証しており、遅速DNNモデルに比べて推論速度が32%向上した。
  • GPUおよびCPU上での推論時間は、ベースラインの遅速モデルに比べて54%短縮されたが、分類誤差はわずか1%増加した。
  • ヒストグラムビニングや他のベースラインとは異なり、本手法はすべてのξ値のテストにおいて一貫して望ましい誤差境界を満たしており、ベースラインは頻繁にそれを逸脱した。
  • 安全な計画において、本手法は高確率で望ましい安全率(ξ)を達成したが、固定または適応的しきい値を用いたナーブなアプローチは、特に低いξ値において安全制約を満たせなかった。
  • ヒストグラムビニングベースラインは速度と安全率において類似していたが、理論的保証がなく、本手法は高確率で絶対的正しさを提供する点で優位であった。
  • 信頼区間の計算に要する時間は無視できるほど短く、実時間デプロイメントにおいて実用的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。