Skip to main content
QUICK REVIEW

[論文レビュー] Predictive Uncertainty Quantification with Compound Density Networks

Agustinus Kristiadi, Däubener, Sina|arXiv (Cornell University)|Feb 4, 2019
Adversarial Robustness in Machine Learning参考文献 42被引用数 11
ひとこと要約

本稿では、連続的で入力に依存する混合モデルであるCompound Density Networks(CDNs)を紹介する。CDNsは、非可算個の成分分布と、入力に応じた適応的で入力固有の混合重みを、ニューラルネットワークを用いてパrameter化することで、Mixture Density Networksを一般化したものである。CDNsは、ベイジアンニューラルネットワークやディープアンサンブルと比較して、予測不確実性の定量化が優れており、特にFGSM攻撃下において、敵対的例に対する耐性が向上している。変分ベイズ学習により、分布外(OOD)入力や敵対的入力の検出が、予測エントロピーの増加によって可能となる。

ABSTRACT

Despite the huge success of deep neural networks (NNs), finding good mechanisms for quantifying their prediction uncertainty is still an open problem. Bayesian neural networks are one of the most popular approaches to uncertainty quantification. On the other hand, it was recently shown that ensembles of NNs, which belong to the class of mixture models, can be used to quantify prediction uncertainty. In this paper, we build upon these two approaches. First, we increase the mixture model's flexibility by replacing the fixed mixing weights by an adaptive, input-dependent distribution (specifying the probability of each component) represented by NNs, and by considering uncountably many mixture components. The resulting class of models can be seen as the continuous counterpart to mixture density networks and is therefore referred to as compound density networks (CDNs). We employ both maximum likelihood and variational Bayesian inference to train CDNs, and empirically show that they yield better uncertainty estimates on out-of-distribution data and are more robust to adversarial examples than the previous approaches.

研究の動機と目的

  • 深層ニューラルネットワークにおける信頼性の高い予測不確実性の定量化、特に分布外(OOD)および敵対的入力に対して課題を解決すること。
  • ベイジアンニューラルネットワークやディープアンサンブルなどの既存手法を改善するため、より柔軟で連続的な混合モデルアーキテクチャを導入すること。
  • 連続的で入力に依存する予測分布の混合により、エピステミック不確実性とアレアトリック不確実性の両方を捉えるフレームワークを構築すること。
  • 敵対的攻撃下における不確実性推定の耐性を評価し、最先端のベースラインと性能を比較すること。

提案手法

  • CDNsは、予測分布を非可算個の成分分布の連続的混合としてモデル化し、ハイパーネットと呼ばれるニューラルネットワークがモデルパラメータの分布を出力することでパラメータ化する。
  • 混合分布は入力に依存し、ニューラルネットワークによってモデル化され、入力の文脈に応じて成分の重みを適応的に変更可能である。
  • 最大尤度訓練は、CDNフレームワーク下での予測分布の対数尤度を最適化することで実行される。
  • 変分ベイジアン推論を用いてCDNパラメータの事後分布を学習し、モデル重みと予測の不確実性の定量化を可能にする。
  • ハイパーネットを用いて、入力を条件として予測ネットワークのパラメータ(例:平均と分散)を生成することで、柔軟で入力固有の不確実性推定が可能になる。
  • このフレームワークは全結合ネットワークに適用され、MNIST、Fashion-MNIST、CIFAR-10でFGSM敵対的例とOODデータを用いて評価された。

実験結果

リサーチクエスチョン

  • RQ1連続的で入力に依存する混合モデルは、離散的混合モデルやベイジアンベースラインと比較して、深層ニューラルネットワークにおける不確実性定量化を改善できるか?
  • RQ2CDNsは、予測エントロピーの増加によって、分布外入力を効果的に検出できるか?
  • RQ3CDNsは、特にFGSM攻撃下で、敵対的例に対する耐性をどの程度向上できるか?
  • RQ4CDNsの変分ベイジアン学習は、エピステミック不確実性推定の向上と分布シフトの検出能力の向上に寄与するか?

主な発見

  • ML-CDNは、摂動強度が1.0までの敵対的MNIST例において、すべてのベースラインと比較して顕著に高い正確性を達成し、予測エントロピーも着実に増加した。
  • VB-CDNは、MNISTおよびFashion-MNISTにおいて、Deep Probabilistic Network(DPN)ベースラインの不確実性推定を同等または上回り、トレーニング時に追加のOODデータを必要としないにもかかわらず、より高い正確性を達成した。
  • ML-CDNとVB-CDNの両方とも、敵対的攻撃に対して強く耐性がある:各訓練イテレーションで10ステップの勾配を用いる場合、強力なFGSM摂動下でも70%以上の正確性を維持した。
  • 複数回の前向き・後向きパスで敵対的例を生成する(より強い攻撃)場合、CDNsの性能は僅かに低下するにとどまり、非常に高い耐性を示した。
  • CIFAR-10では、VB-CDNが競争力ある性能を示し、このアプローチがより複雑な視覚ベンチマークへスケーラブルであることを示した。
  • CDNsはOODデータにおける不確実性を効果的に捉えており、分布外のサンプルでは高いエントロピーを示し、一方で分布内入力では高い信頼性を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。