[論文レビュー] On Expressivity and Trainability of Quadratic Networks
この論文はスプライン理論と代数幾何学を用いて、従来のネットワークやReLU活性化を用いたネットワークに比べ、2次ニューラルネットワークが優れた表現力を持つことを理論的に示している。本研究では、2次の重みを再初期化することで学習を安定化させる、ReLinearと呼ばれる新たな訓練戦略を提案しており、CIFAR-10 や KITTI といった画像分類および深度推定ベンチマークで顕著な性能向上を達成している。
Inspired by the diversity of biological neurons, quadratic artificial neurons can play an important role in deep learning models. The type of quadratic neurons of our interest replaces the inner-product operation in the conventional neuron with a quadratic function. Despite promising results so far achieved by networks of quadratic neurons, there are important issues not well addressed. Theoretically, the superior expressivity of a quadratic network over either a conventional network or a conventional network via quadratic activation is not fully elucidated, which makes the use of quadratic networks not well grounded. Practically, although a quadratic network can be trained via generic backpropagation, it can be subject to a higher risk of collapse than the conventional counterpart. To address these issues, we first apply the spline theory and a measure from algebraic geometry to give two theorems that demonstrate better model expressivity of a quadratic network than the conventional counterpart with or without quadratic activation. Then, we propose an effective training strategy referred to as ReLinear to stabilize the training process of a quadratic network, thereby unleashing the full potential in its associated machine learning tasks. Comprehensive experiments on popular datasets are performed to support our findings and confirm the performance of quadratic deep learning. We have shared our code in \url{https://github.com/FengleiFan/ReLinear}.
研究の動機と目的
- 2次ネットワークが、同じアーキテクチャのもとで従来のネットワークやReLU活性化を用いた従来のネットワークよりも高いモデル表現力を持つことを理論的に証明すること。
- 高次多項式出力をもつため、2次ネットワークの学習中に生じる不安定性および崩壊のリスクを解消すること。
- 2次ネットワークの安定した最適化を可能にする実用的で効果的な訓練戦略を開発すること。
- 理論的主張と提案手法の有効性を、多様な機械学習タスクにおいて実験的に検証すること。
- 既存モデル(例:LapDepth)における従来のニューロンを2次ニューロンに置き換えることで、測定可能な性能向上が得られることを示すこと。
提案手法
- スプライン理論を用いて、同じアーキテクチャのもとで2次ネットワークが従来のネットワークよりも高い表現力を持つ関数を表現できることを証明する。
- 代数幾何学における測度を用いて、2次ネットワークとReLU活性化を用いた従来のネットワークの表現力の違いを比較する。
- 2次重み行列をゼロにリセットし、線形重みを再初期化することで学習を安定化させる、ReLinearと呼ばれるリセット戦略を提案する。
- 2次重みをゼロにリセットし、線形重みにはKaiming初期化を適用することで、勾配爆発と出力の振動を低減する。
- AdamW、学習率スケジューリング、バッチ正則化といった標準的なディープラーニングの訓練プロトコルを採用し、ReLinearは2次層にのみ適用する。
- ResNeXtおよびLapDepthにおける従来のニューロンを2次ニューロンに置き換えることで、画像分類(CIFAR-10、CIFAR-100)および深度推定(KITTI)の両タスクで手法を検証する。

実験結果
リサーチクエスチョン
- RQ1同じアーキテクチャのもとで、2次ネットワークは従来のネットワークやReLU活性化を用いた従来のネットワークでは表現できない関数を表現できるか?
- RQ22次ネットワークが従来モデルやReLU活性化モデルに比べて優れた表現力を持つ背後にある理論的メカニズムは何か?
- RQ3なぜ2次ネットワークは従来のネットワークに比べて高い学習不安定性と崩壊のリスクを示すのか?
- RQ4ReLinearのような単純なリセット戦略が、アーキテクチャの変更なしに2次ネットワークの学習を効果的に安定化させられるか?
- RQ5既存モデルにおける従来のニューロンを2次ニューロンに置き換えることで、実世界のタスクで測定可能な性能向上が得られるか?
主な発見
- スプライン理論と代数幾何学を用いた理論的分析により、2次ネットワークが従来のネットワークおよびReLU活性化を用いた従来のネットワークよりも高い表現力を持つことが確認された。
- 2次ネットワークは特定の関数を多項式サイズのアーキテクチャで表現できる一方、従来のネットワークは同じ近似を達成するためには指数的サイズのアーキテクチャを必要とする。
- 1変数のアブレーションでは、重み初期化の分散のわずかな変化が2次ネットワークの出力に著しい変動を引き起こすことが明らかになり、学習の不安定性の理由が説明された。
- CIFAR-10では、ReLinear正則化を施した2次ネットワークが95.8%のテスト精度を達成し、ベースラインの従来ネットワークを上回った。
- KITTI深度推定ベンチマークでは、Quadratic-LapDepthが、ベースラインのLapDepthと比較して、Sq Relを0.214から0.200へ、RMSEを0.458から0.427へと低下させた。
- 提案されたReLinear戦略は、アーキテクチャの変更なしに、2次ネットワークの学習を効果的に安定化させ、複数のタスクで最先端の性能を達成することが可能となった。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。