[論文レビュー] Why bigger is not always better: on finite and infinite neural networks
この論文は、無限幅のベイジアンニューラルネットワークが有限ネットワークに劣る理由として、カーネルが固定されており表現学習ができないことにあると主張する。バナディンクを備えた無限ネットワークを導入することで、理論的取り扱いやすさを保ちつつカーネルの適応を可能にし、解析と実験により、実際の最先端ネットワーク(例:ResNets)が出力カーネルに近い表現を学習していることが示された—これは無限ネットワークの予測とは対照的である。
Recent work has argued that neural networks can be understood theoretically by taking the number of channels to infinity, at which point the outputs become Gaussian process (GP) distributed. However, we note that infinite Bayesian neural networks lack a key facet of the behaviour of real neural networks: the fixed kernel, determined only by network hyperparameters, implies that they cannot do any form of representation learning. The lack of representation or equivalently kernel learning leads to less flexibility and hence worse performance, giving a potential explanation for the inferior performance of infinite networks observed in the literature (e.g. Novak et al. 2019). We give analytic results characterising the prior over representations and representation learning in finite deep linear networks. We show empirically that the representations in SOTA architectures such as ResNets trained with SGD are much closer to those suggested by our deep linear results than by the corresponding infinite network. This motivates the introduction of a new class of network: infinite networks with bottlenecks, which inherit the theoretical tractability of infinite networks while at the same time allowing representation learning.
研究の動機と目的
- 最先端の有限ニューラルネットワークと無限ベイジアンニューラルネットワークの性能差を説明すること。
- 無限ネットワークの性能が低い根本的原因を特定すること:表現学習ができないため、上位層のカーネルが固定されていること。
- 理論的取り扱いやすさを保ちつつカーネル適応と表現学習を可能にする、新たな理論的モデル体系(ボトルネック付き無限ネットワーク)を構築すること。
- 実験的に、SGDで訓練された実際のネットワーク(例:ResNets)が、入力カーネルではなく出力カーネルに近い表現を学習していることを検証すること。
- 表現学習のダイナミクスを深層線形ネットワークでモデル化することで、理論的無限ネットワークと実用的有限ネットワークの溝を埋めること。
提案手法
- 有限深層線形ネットワークにおける表現の事前共分散を分析し、カーネルの柔軟性を定量化する。
- 理論的取り扱いやすさと学習可能な表現を組み合わせたハイブリッドモデルとして、ボトルネック付き無限ネットワークを導入する。
- 解析的導出を用いて、空間的に構造化された入力下で、より細く深いネットワークやCNNがLCNよりも高い表現の柔軟性を示すことを示す。
- MAP推論と事後分布サンプリングを用いて、訓練過程における表現の入力カーネル(入力内積)から出力カーネル(ラベルのone-hot内積)への移行を追跡する。
- 幅対出力比(N/Y → 0, ∞, および N/Y = 1)の変化に伴う上位層カーネル行動の漸近的極限を導出する。
- CIFAR-10で訓練されたResNetsにおける表現を、深層線形モデルからの理論的予測と比較することで、主張を検証する。
実験結果
リサーチクエスチョン
- RQ1正確なベイジアン推論が最適であるにもかかわらず、なぜ無限ベイジアンニューラルネットワークはSGDで訓練された有限ネットワークに劣るのか?
- RQ2無限ネットワークにおける固定カーネルが表現学習をどのように妨げ、性能を制限するのか?
- RQ3有限深層線形ネットワークにおける表現の柔軟性は何かによって決定され、それが無限ネットワークの挙動とどのように異なるのか?
- RQ4理論的取り扱いやすさを保ちつつカーネル適応と表現学習を可能にする無限ネットワークのクラスを設計できるか?
- RQ5SGDで訓練された実際の最先端ネットワーク(例:ResNets)における表現は、無限ネットワークモデルが予測するものとどのように異なるのか?
主な発見
- 無限ベイジアンニューラルネットワークは、上位層のカーネルがハイパーパrameterによって固定されているため、表現学習が不可能であり、一般化性能が低い。
- 有限深層線形ネットワークでは、より細く深い構造が表現の柔軟性を高め、空間的に構造化された入力ではCNNがLCNを上回る。
- MAPおよび事後分布サンプリングの両方において、学習済みネットワークの表現は、入力カーネル(入力内積)から出力カーネル(ラベルのone-hot内積)へと移行する。
- MAP推論ではネットワーク幅に関係なくこの移行が発生するが、ベイジアンネットワークでは幅を増やすと表現が事前分布に支配され、データへの応答性が低下する。
- CIFAR-10でSGDで訓練されたResNetでは、学習済み表現が入力カーネルよりもはるかに出力カーネルに近く、ボトルネック付き深層線形モデルの予測と一致する。
- 上位層カーネルの漸近的挙動は、隠れユニット数と出力チャネル数の比に依存する:N/Y → 0 のとき出力カーネルに収束し、N/Y → ∞ のとき恒等写像に収束し、N/Y = 1 のとき中間的挙動を示す。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。