Skip to main content
QUICK REVIEW

[論文レビュー] HyperGAN: A Generative Model for Diverse, Performant Neural Networks

Neale Ratzlaff, Fuxin Li|arXiv (Cornell University)|Jan 30, 2019
Generative Adversarial Networks and Image Synthesis参考文献 19被引用数 14
ひとこと要約

HyperGANは、各層の重み生成のための学習可能なミキサーを備えたGANベースのアプローチを用いて、多様で高性能なニューラルネットワーク重みの分布を学習する新しい生成モデルを導入する。この手法により、微調整を必要とせず、高品質で多様なアンサンブルの効率的なサンプリングが可能となり、分布外データおよび悪意ある攻撃データにおいて、競争力ある精度と優れた不確実性推定が達成される。

ABSTRACT

Standard neural networks are often overconfident when presented with data outside the training distribution. We introduce HyperGAN, a new generative model for learning a distribution of neural network parameters. HyperGAN does not require restrictive assumptions on priors, and networks sampled from it can be used to quickly create very large and diverse ensembles. HyperGAN employs a novel mixer to project prior samples to a latent space with correlated dimensions, and samples from the latent space are then used to generate weights for each layer of a deep neural network. We show that HyperGAN can learn to generate parameters which label the MNIST and CIFAR-10 datasets with competitive performance to fully supervised learning, while learning a rich distribution of effective parameters. We also show that HyperGAN can also provide better uncertainty estimates than standard ensembles by evaluating on out of distribution data as well as adversarial examples.

研究の動機と目的

  • 制限的な事前分布や変分的仮定を用いずに、ニューラルネットワーク重みの豊かで多様な分布を学習すること。
  • 1回の順伝播で大規模で多様なニューラルネットワークアンサンブルを効率的に生成できること。
  • アンサンブルの多様性を活用して、分布外データおよび悪意ある例に対する不確実性推定を改善すること。
  • 標準的なアンサンブルや変分的手法の限界を克服し、重みのより表現力のある事後分布を学習すること。
  • 反復的トレーニングや微調整を必要とせずに、多様で高性能なモデルの生成をスケーラブルに可能とすること。

提案手法

  • 生成器ネットワークは、多次元ガウス分布の潜在コードを入力とし、各層の重みに対して相関のあるベクトルを生成するための学習可能なミキサーを用いる。
  • ミキサーは、独立したノイズを、層間の重みの一貫性を保証する構造化された潜在ベクトルに変換する。
  • 生成器は、ターゲットタスク損失(例:分類)の最尤推定に基づいてトレーニングされ、正確なモデルを生成する。
  • 敵対的ディスクライマーは、モード崩壊を防ぎ、生成されたネットワークの多様性を高めるために潜在空間を正則化する。
  • 性能と多様性の両方を同時に最適化することで、可逆フローまたは固定ノイズモデルへの依存を回避する。
  • 生成器からのサンプリングにより、1回の順伝播で完全でトレーニング可能なニューラルネットワークが得られ、スケーラブルなアンサンブル作成が可能になる。

実験結果

リサーチクエスチョン

  • RQ1制限的な事前分布を用いずに、多様で高性能なニューラルネットワーク重みの分布を生成モデルが学習できるか?
  • RQ2HyperGANのミキサー機構は、ネットワーク層間の最適化とパラメータの一貫性をどのように改善するか?
  • RQ3HyperGANで生成されたアンサンブルは、分布外および悪意ある入力において、標準アンサンブルを上回る不確実性推定を達成できるか?
  • RQ4可逆フローまたは固定ノイズモデルの欠如が、重み生成におけるスケーラビリティや性能に悪影響を及えるか?
  • RQ5敵対的正則化は、生成されたネットワーク集団における多様性を向上させ、モード崩壊を防止するのにどの程度効果的か?

主な発見

  • HyperGANは、微調整を必要とせず、MNISTおよびCIFAR-10で競争力ある分類精度を達成する、完全で多層の畳み込みネットワークを生成する。
  • HyperGANからサンプリングされた100個のネットワークのアンサンブルは、単一モデルや標準アンサンブルと比較して、テスト精度が顕著に向上する。
  • L2ノルムの相対的標準偏差で測定したHyperGANで生成されたモデルの多様性は、標準トレーニングや変分的手法と比較して顕著に高い。
  • HyperGANアンサンブルは、分布外のサンプルや悪意ある例(例:FGSM、PGD)を、同等サイズの標準アンサンブルよりも効果的に検出する。
  • ディスクライマーを除去すると、精度は類似しているものの多様性が低下するため、その分布の広がりを促進する役割が確認される。
  • ミキサーを除去すると、多様性が著しく低下し、収束速度も遅くなるため、層間での効果的な最適化を可能にする上でその重要性が示される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。