Skip to main content
QUICK REVIEW

[論文レビュー] On approximating $ abla f$ with neural networks

Saeed Saremi|arXiv (Cornell University)|Oct 28, 2019
Model Reduction and Neural Networks参考文献 13被引用数 8
ひとこと要約

この論文は、滑らかな関数 $f$ の勾配 $\nabla f$ を近似するためには、1つ以上の隠れ層を有する深層フィードフォワードニューラルネットワーク ($\psi$) が、すべての入力および出力重みが平行である場合に限り可能であることを証明しており、これは表現力の大幅な制限をもたらす。代替として、$\nabla\phi \approx \nabla f$ となるような $\phi$ を用いた暗黙的パラメータ化を提案する。これにより、対称性制約を回避でき、深さに依存する普遍近似が可能になる。

ABSTRACT

Consider a feedforward neural network $ψ: \mathbb{R}^d ightarrow \mathbb{R}^d$ such that $ψ\approx abla f$, where $f:\mathbb{R}^d ightarrow \mathbb{R}$ is a smooth function, therefore $ψ$ must satisfy $\partial_j ψ_i = \partial_i ψ_j$ pointwise. We prove a theorem that a $ψ$ network with more than one hidden layer can only represent one feature in its first hidden layer; this is a dramatic departure from the well-known results for one hidden layer. The proof of the theorem is straightforward, where two backward paths and a weight-tying matrix play the key roles. We then present the alternative, the implicit parametrization, where the neural network is $ϕ: \mathbb{R}^d ightarrow \mathbb{R}$ and $ abla ϕ\approx abla f$; in addition, a "soft analysis" of $ abla ϕ$ gives a dual perspective on the theorem. Throughout, we come back to recent probabilistic models that are formulated as $ abla ϕ\approx abla f$, and conclude with a critique of denoising autoencoders.

研究の動機と目的

  • 滑らかな関数 $f$ の勾配 $\nabla f$ を近似する深層フィードフォワードネットワーク ($\psi$) の表現能力を調査すること。
  • 深さが1より大きい場合に $\psi$ が $\nabla f$ を表現できなくなる構造的制約、特に対称性条件 $\partial_j\psi_i = \partial_i\psi_j$ を同定すること。
  • 入力 $\psi$ ネットワークの制約を回避するため、$\nabla\phi \approx \nabla f$ となるような $\phi$ を用いた代替的パラメータ化を提案すること。
  • 確率的モデルやスコア関数 $\nabla f$ の近似に依存するノイズ除去オートエナドアの文脈における影響を分析すること。

提案手法

  • 滑らかな関数 $f$ の混合偏微分の対称性に起因する、$\psi$ が $\nabla f$ を近似できるための必要条件 $\partial_j\psi_i = \partial_i\psi_j$ を導出する。
  • 深層ネットワーク($L > 2$)において、この制約の唯一の解がすべての入力重み $\theta_m^{(0)}$ と出力重み $\theta_n^{(L-1)}$ が平行であることであることを証明し、表現能力が著しく制限されることを示す。
  • 関数 $\phi: \mathbb{R}^d \to \mathbb{R}$ を用いた暗黙的パラメータ化フレームワークを導入し、$\nabla\phi$ を用いて $\nabla f$ を近似することで、対称性制約を回避する。
  • $\nabla\phi$ の「ソフト解析」を実施し、これが $L-1$ 個のニューラルネットワークの積に対応することを示し、従来の $\psi$ ネットワークよりも豊かな計算的構造を有することを示唆する。
  • ノイズ除去オートエナドアを批判的に検証し、同じ対称性制約のため、$\psi$ ネットワークが1層を超えて一般化できないことを示す。

実験結果

リサーチクエスチョン

  • RQ1一般の滑らかな関数 $f$ に対して、1つ以上の隠れ層を有する深層フィードフォワードニューラルネットワーク $\psi: \mathbb{R}^d \to \mathbb{R}^d$ は $\nabla f$ を近似可能か?
  • RQ2深層ネットワークにおいて、条件 $\partial_j\psi_i = \partial_i\psi_j$ が生じる構造的制約とは何か? そして、これらはパラメータ化の能力をどのように制限するか?
  • RQ3スコア関数 $\nabla f$ の近似において、なぜノイズ除去オートエナドアは1層を超えて一般化できないのか?
  • RQ4深層ネットワーク $\phi: \mathbb{R}^d \to \mathbb{R}$ の勾配 $\nabla\phi$ は、$\psi$ ネットワークの制限を考慮しても、$\nabla f$ を普遍的に近似できるか?

主な発見

  • 深層ネットワーク($L > 2$)において、対称性制約 $\partial_j\psi_i = \partial_i\psi_j$ がすべての入力重み $\theta_m^{(0)}$ と出力重み $\theta_n^{(L-1)}$ が平行であることを強制し、最初の隠れ層で1つの特徴しか表現できなくなる。
  • すべての $i,j,m$ に対して $\theta_{im}^{(1)}\theta_{mj}^{(0)} = \theta_{jm}^{(1)}\theta_{mi}^{(0)}$ が成り立つ必要があるが、これは深層アーキテクチャでは平行重み制約の下でのみ満たせる。
  • 暗黙的パラメータ化による $\phi$ は対称性制約を回避でき、$\nabla\phi$ が $L-1$ 個のネットワークの積に対応するため、深層ネットワークが $\nabla f$ を普遍的に表現可能になる。
  • ノイズ除去オートエナドアは、$\psi \approx \nabla f$ を暗黙的に定義するが、同じ対称性制約のため、1層を超えて一般化できない。一方、1層の場合には一般化可能である。
  • 分析により、根本的な相転移が明らかになった:1層の $\psi$ ネットワークは重みを共有することで $\nabla f$ を表現可能だが、より深い $\psi$ ネットワークは、1つの特徴に制限されない限り、機能しない。このため、$\phi$ が深層ネットワークの唯一の実行可能な代替手段となる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。