Skip to main content
QUICK REVIEW

[論文レビュー] An Improved Bound on the VC-Dimension of Neural Networks with Polynomial Activation Functions

J. Maurice Rojas, M. Vidyasagar|ArXiv.org|Dec 19, 2001
Neural Networks and Applications参考文献 4被引用数 3
ひとこと要約

本稿では、Rojas (2000) が得た洗練された半代数幾何の結果を活用することで、多項式活性化関数を備えたフィードフォワードニューラルネットワークのVC次元に対するより鋭い上界を提示する。重みパラメータの各層における次数分布を分析し、相対エントロピーを用いて改善度を定量化することで、古典的な Goldberg-Jerrum の上界よりも厳密に鋭い上界を導出する。数値例では、推定値を最大で12.5%まで低減できる。

ABSTRACT

In this note, we derive an improved upper bound for the VC-dimension of neural networks with polynomial activation functions. This improved bound is based on a result of Rojas on the number of connected components of a semi-algebraic set.

研究の動機と目的

  • 多項式活性化関数を有するニューラルネットワークの古典的VC次元上界を改善すること。
  • Milnorの定理に依存するのみで総次数と変数数に依存する過去の上界の緩さを是正すること。
  • 重みパラメータの各層における次数分布をVC次元解析に組み込むこと。
  • 各層ごとのパラメータ数と次数から導かれる確率ベクトル間の相対エントロピーを用いて、上界の改善度を定量化すること。
  • 新しい上界がネットワークアーキテクチャの観点から直感的に解釈可能であり、かつより鋭いことの確認

提案手法

  • Rojas (2000) が得た半代数的集合の連結成分の数に関する結果を用い、多項式の次数と変数のグループ化に依存する。
  • ニューラルネットワークを重み空間における多項式不等式・等式のブール結合としてモデル化する。
  • 各重みベクトル $\mathbf{w}_i$ に対して、その最大総次数を表す層固有の次数上限 $d_i$ を定義する。
  • 臨界値集合の体積に上界を適用する際、多項式係数と階乗の積 $k! \prod_{i=1}^l \frac{d_i^{k_i}}{k_i!}$ を用いる。
  • Stirlingの近似を用いて、二つの確率ベクトル $\mathbf{v}$ と $\mathbf{u}$ の相対エントロピー $H(\mathbf{v}|\mathbf{u})$ を含む閉形式の上界を導出する。
  • 洗練された体積上界と定理1を組み合わせることで、最終的なVC次元上界 $2k(\lg(4ed) - H(\mathbf{v}|\mathbf{u}))$ を導出する。

実験結果

リサーチクエスチョン

  • RQ1多項式活性化関数を有するニューラルネットワークのVC次元を、各層における次数分布の情報を活用することで、より鋭く上界で抑えられるか?
  • RQ2各層の正規化次数ベクトルと正規化パラメータ数ベクトルの間の相対エントロピーは、VC次元上界にどのように影響を与えるか?
  • RQ3各層における多項式次数のより洗練された情報が得られた場合、古典的なMilnor型上界はどの程度改善できるか?
  • RQ4上界の改善は定量的に有意であり、ネットワークアーキテクチャの観点から解釈可能か?
  • RQ5新しい上界は、Goldberg-Jerrum の上界と比較して、非自明な割合で推定値を低減する条件は何か?

主な発見

  • 提案された上界は、重みパラメータの各層における次数分布の情報を組み込むことで、古典的な Goldberg-Jerrum の上界を改善している。
  • 改善度は $2k \cdot H(\mathbf{v}|\mathbf{u})$ として定量化され、ここで $H(\mathbf{v}|\mathbf{u})$ は正規化次数ベクトル $\mathbf{v}$ と正規化パラメータ数ベクトル $\mathbf{u}$ 間の相対エントロピーである。
  • 数値例として $k_1=50$, $k_2=20$, $d_1=3$, $d_2=1$ を用いた場合、上界は従来の推定値よりも約12.5%鋭くなっている。
  • すべての状況で Goldberg-Jerrum の上界よりも厳密に鋭いが、次数分布とパラメータ数分布が各層で完全に一致する場合に限り、改善が得られない。
  • 本手法は、ネットワークアーキテクチャ(各層のサイズと活性化関数の次数)と一般化能力(VC次元)の関係を原理的かつ明確に示す。
  • 最終的な上界は $\mathrm{VCDIM}(\Phi) \leq 2k(\lg(4ed) - H(\mathbf{v}|\mathbf{u}))$ として表され、$H(\mathbf{v}|\mathbf{u}) > 0$ のとき、$2k\lg(4ed)$ よりも鋭くなる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。