[論文レビュー] Deep Ensembles on a Fixed Memory Budget: One Wide Network or Several Thinner Ones?
この論文は、固定されたメモリ予算のもとで、単一のワイドなニューラルネットワークと、薄いネットワークのアンサンブルのどちらが性能を向上させるかを調査する。その結果、メモリを中程度の幅のネットワークのアンサンブルに分割する(メモリスプリットアドバンテージ、MSA)ことで、単一のワイドネットワークや非常に多くの薄いネットワークのアンサンブルよりも一貫して優れた性能が得られ、WideResNet-28-10の設定を用いたCIFAR-100では最大1.92%の精度向上が確認された。
One of the generally accepted views of modern deep learning is that increasing the number of parameters usually leads to better quality. The two easiest ways to increase the number of parameters is to increase the size of the network, e.g. width, or to train a deep ensemble; both approaches improve the performance in practice. In this work, we consider a fixed memory budget setting, and investigate, what is more effective: to train a single wide network, or to perform a memory split -- to train an ensemble of several thinner networks, with the same total number of parameters? We find that, for large enough budgets, the number of networks in the ensemble, corresponding to the optimal memory split, is usually larger than one. Interestingly, this effect holds for the commonly used sizes of the standard architectures. For example, one WideResNet-28-10 achieves significantly worse test accuracy on CIFAR-100 than an ensemble of sixteen thinner WideResNets: 80.6% and 82.52% correspondingly. We call the described effect the Memory Split Advantage and show that it holds for a variety of datasets and model architectures.
研究の動機と目的
- 固定されたメモリ予算を、単一のワイドネットワークに使用するか、薄いネットワークのアンサンブルに使用するかのどちらがより良い性能をもたらすかを調査すること。
- 性能を最大化するために、モデルの幅とアンサンブルサイズの間の最適なメモリ配分を特定すること。
- メモリスプリットアドバンテージ(MSA)が、さまざまなデータセット、アーキテクチャ、ハイパーパramータ設定においても成り立つかを評価すること。
- MSAの影響が分類精度と不確実性推定の質の両方においてどのように現れるかを評価すること。
提案手法
- 著者たちは、複数のデータセットとアーキテクチャにおいて、同じ合計パラメータ数を持つ単一のワイドネットワークと、薄いネットワークのアンサンブルを比較した。
- VGG、WideResNet、Transformerモデルを用いて、CIFAR-10、CIFAR-100、IWSLT’14で実験を行った。
- 公平な比較を確保するため、ハイパーパramータはベイジアン最適化とグリッドサーチを用いて調整した。
- 性能はテスト精度と不確実性推定のための補正済みネガティブ・ログリクアリティ(NLL)を用いて評価した。
- 合計パラメータ数を一定に保ちながら、ネットワーク数(N)と幅(S)を変更することで、メモリのスプリットを体系的に変化させた。
- MSA効果は、テスト精度を最大化し、NLLを最小化するアンサンブル構成(N, S)を特定することで定量化した。
実験結果
リサーチクエスチョン
- RQ1合計パラメータ数が固定された状態で、中程度の幅のネットワークのアンサンブルが単一のワイドネットワークを上回るか?
- RQ2固定されたメモリ予算のもとで、性能を最大化するためのアンサンブル内のネットワーク数に最適値があるか?
- RQ3メモリスプリットアドバンテージ(MSA)は、異なるデータセットやモデルアーキテクチャにおいても成り立つか?
- RQ4補正済みNLLで測定した不確実性推定の質において、MSA効果はどのように比較されるか?
- RQ5ハイパーパramータチューニング戦略(ベイジアン最適化対グリッドサーチ)が観察されるMSA効果に影響を与えるか?
主な発見
- 16個の薄いWideResNet(各々80.6%の精度)のアンサンブルは、単一のWideResNet-28-10(82.52%の精度)を上回り、CIFAR-100で1.92%の向上を示した。
- MSAは、大きなアーキテクチャに限らず、小さな構成でも成り立つことが示され、広範な適用可能性を示している。
- 同じ合計パラメータ数のもとで、中程度の幅のネットワークのアンサンブルは、単一のワイドネットワークよりも補正済みテストNLLが低く、不確実性推定が優れていることが示された。
- 最大性能を達成するための最適なアンサンブルサイズ(N)は、通常1より大きく、合計メモリ予算が増加するにつれて増加する傾向にある。
- ベイジアン最適化では単一モデルのテスト精度がグリッドサーチを上回るが、MSA効果は両方のチューニング手法において一貫している。
- MSA効果は、複数のデータセット(CIFAR-10、CIFAR-100)とアーキテクチャ(VGG、WideResNet、Transformer)にわたり、一般化可能であることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。