Skip to main content
QUICK REVIEW

[論文レビュー] Universal Approximation with Quadratic Deep Networks

Fenglei Fan, Jinjun Xiong|arXiv (Cornell University)|Jul 31, 2018
Neural Networks and Applications参考文献 42被引用数 6
ひとこと要約

この論文は、2次的な深層ネットワークが、従来の深層ネットワークと比較して、優れた表現効率、コンactな構造による普遍近似、および強化された計算能力を達成することを確立している。ニューロン内の線形内積を2次関数に置き換えることで、著者たちは4つの定理を証明し、2次ネットワークが関数をより効率的に近似できること、同じ幅の従来ネットワークでは表現できない関数を表現できること、ReLU活性化関数を用いて多項式の正確な因数分解が可能であること、量子化設定下でもパラメータ数が少なくてもよいこと、を示している。

ABSTRACT

Recently, deep learning has achieved huge successes in many important applications. In our previous studies, we proposed quadratic/second-order neurons and deep quadratic neural networks. In a quadratic neuron, the inner product of a vector of data and the corresponding weights in a conventional neuron is replaced with a quadratic function. The resultant quadratic neuron enjoys an enhanced expressive capability over the conventional neuron. However, how quadratic neurons improve the expressing capability of a deep quadratic network has not been studied up to now, preferably in relation to that of a conventional neural network. Regarding this, we ask four basic questions in this paper: (1) for the one-hidden-layer network structure, is there any function that a quadratic network can approximate much more efficiently than a conventional network? (2) for the same multi-layer network structure, is there any function that can be expressed by a quadratic network but cannot be expressed with conventional neurons in the same structure? (3) Does a quadratic network give a new insight into universal approximation? (4) To approximate the same class of functions with the same error bound, is a quantized quadratic network able to enjoy a lower number of weights than a quantized conventional network? Our main contributions are the four interconnected theorems shedding light upon these four questions and demonstrating the merits of a quadratic network in terms of expressive efficiency, unique capability, compact architecture and computational capacity respectively.

研究の動機と目的

  • 2次的な深層ネットワークが、複雑な関数を近似する際、従来の深層ネットワークよりも優れた表現効率を示すかどうかを調査すること。
  • 同じアーキテクチャを持つ2次ネットワークが、従来ネットワークでは表現できない関数を表現できるかどうかを特定すること。
  • 2次ネットワークが、深さと幅を削減することで普遍近似への新たな道筋を提供するかどうかを検討すること。
  • 同じ近似誤差を満たす条件下で、量子化された2次ネットワークが、量子化された従来ネットワークよりも優れたパラメータ効率を達成できるかどうかを評価すること。

提案手法

  • 従来のニューロンにおける線形内積を、入力と重みの2次関数に置き換えた2次ニューロンを提案する。
  • ReLU活性化関数を用いて、データ駆動型の代数的因数分解により多項式関数の正確な表現を可能にする。
  • 近似理論に基づく理論的分析を用いて、2次ネットワークと従来ネットワークの表現能力を比較する。
  • 普遍近似定理を適用し、2次ネットワークが有界な深さと幅で普遍近似を達成できることを示す。
  • 径数関数および多変数多項式関数を近似する際の、量子化された2次ネットワークの複雑さの上限を導出する。
  • 一般化されたバックプロパゲーションアルゴリズムを採用し、2次ネットワークのパラメータをエンドツーエンドで学習可能にする。

実験結果

リサーチクエスチョン

  • RQ11層の隠れ層を持つネットワークにおいて、2次ネットワークが従来ネットワークよりもより効率的に近似可能な関数クラスが存在するか?
  • RQ2同じ多層アーキテクチャにおいて、2次ネットワークが表現可能だが従来ネットワークが表現できない関数が存在するか?
  • RQ32次ネットワークのフレームワークは、普遍近似理論における新たな手法や洞察を提供するか?
  • RQ4同じ関数クラスと誤差境界を満たす条件下で、量子化された2次ネットワークが、量子化された従来ネットワークよりも少ないパラメータ数で実現可能か?

主な発見

  • 最初の定理は、2次ネットワークが、従来ネットワークよりもはるかに低い幅と深さの要件で特定の関数を近似できることを証明しており、優れた表現効率を示している。
  • 2番目の定理は、1層あたり4つのニューロンしか持たないReLU型2次ネットワークが、任意の方向で定数でない径数関数を普遍的に近似できることを示しており、同じ幅制約下では従来ネットワークでは達成できない能力である。
  • 3番目の定理は、任意の多変数多項式がReLU活性化関数を用いた2次ネットワークで正確に表現できることを確立しており、局所的でない、非区分的近似が可能である(従来ネットワークは区分的線形近似に依存するのと対照的)。
  • 4番目の定理は、量子化された2次ネットワークのパラメータ複雑さが滑らかさパラメータλに依存しないことを示しており、複雑さの上限が𝒪(λ(log¹⁄⁽λ⁻¹⁾⁺¹(1⁄ε))(1⁄ε)ᵈ⁄ⁿ) に抑えられ、λに依存せず、従来のネットワークよりも効率的である。
  • 1つの2次ニューロンが従来ニューロンの3倍のパラメータを持つにもかかわらず、径数関数の近似や多変数多項式表現の重要なケースでは、2次ネットワークの総パラメータ数が少ない。
  • 結果から、2次ネットワークは非常に柔軟であることが示唆される:区分的近似には従来ネットワークに退化可能であり、またグローバルな代数的因数分解器として機能可能であり、オッカムの剃刀に従った一般化の向上が期待できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。