Skip to main content
QUICK REVIEW

[论文解读] Learning One-hidden-layer Neural Networks under General Input Distributions

Weihao Gao, Ashok Vardhan Makkuva|arXiv (Cornell University)|Oct 9, 2018
Domain Adaptation and Few-Shot Learning参考文献 6被引用 14
一句话总结

本文提出了一种统一框架,用于在一般输入分布(而不仅限于高斯分布)下一隐藏层神经网络中设计具有有利优化景观的损失函数。通过引入一种新颖的局部似然得分函数估计器(LLSFE),该方法使随机梯度下降能够全局收敛至真实参数,优于以往在非高斯数据下因景观假设不匹配而失效的方法。

ABSTRACT

Significant advances have been made recently on training neural networks, where the main challenge is in solving an optimization problem with abundant critical points. However, existing approaches to address this issue crucially rely on a restrictive assumption: the training data is drawn from a Gaussian distribution. In this paper, we provide a novel unified framework to design loss functions with desirable landscape properties for a wide range of general input distributions. On these loss functions, remarkably, stochastic gradient descent theoretically recovers the true parameters with global initializations and empirically outperforms the existing approaches. Our loss function design bridges the notion of score functions with the topic of neural network optimization. Central to our approach is the task of estimating the score function from samples, which is of basic and independent interest to theoretical statistics. Traditional estimation methods (example: kernel based) fail right at the outset; we bring statistical methods of local likelihood to design a novel estimator of score functions, that provably adapts to the local geometry of the unknown density.

研究动机与目标

  • 解决现有神经网络训练方法依赖于严格高斯输入假设的局限性。
  • 为一般光滑输入分布下一隐藏层神经网络设计具有全局良好优化景观的损失函数。
  • 在未知密度下,开发一种一致且适应几何结构的得分函数估计器——这对景观设计至关重要。
  • 通过所提出的损失函数,使随机梯度下降在全局初始化下能全局恢复真实网络参数。

提出的方法

  • 提出一种新颖的局部似然得分函数估计器(LLSFE),可自适应捕捉输入密度的局部几何结构。
  • 利用输入概率密度函数(PDF)的高阶导数,构建具有景观感知能力的损失函数。
  • 设计一种新的损失函数 $ L(A) $,其依赖于估计的得分函数 $ \widehat{\mathcal{S}}_m(x) $,确保有利的优化特性。
  • 采用全批量梯度下降与全局初始化训练网络,利用改进后的优化景观。
  • 将LLSFE与理论损失函数结合,构建实际可用的实证目标 $ \widehat{L}(A) $。
  • 在高斯和非高斯输入(如拉普拉斯分布、高斯混合分布)上验证方法,显示其鲁棒性。

实验结果

研究问题

  • RQ1我们能否在一般输入分布下一隐藏层神经网络中,设计出具有全局良好优化景观的损失函数?
  • RQ2当底层密度未知且非高斯时,如何从样本中一致估计得分函数(即对数密度的梯度)?
  • RQ3一种能适应局部密度几何结构的得分函数估计器,是否相比核方法或k-NN方法能提升优化性能?
  • RQ4在使用所提出的损失函数且输入为非高斯分布时,采用全局初始化的随机梯度下降能否收敛至真实参数?
  • RQ5所提出的方法在经验上与现有方法(如仅在高斯假设下有效的 $ G(\cdot) $)相比如何?

主要发现

  • 所提出的损失函数 $ L(A) $ 与LLSFE估计器结合后,可在一般输入分布(包括非高斯分布)下,使随机梯度下降全局收敛至真实参数。
  • 在拉普拉斯分布输入下,标准 $ \ell_2 $-损失和高斯专用的 $ G(\cdot) $ 损失收敛至次优临界点,而 $ \widehat{L}(A) $ 成功收敛至全局最小值。
  • 在高斯混合输入下,由于假设不匹配,$ G(\cdot) $ 失败,但结合LLSFE的 $ \widehat{L}(A) $ 仍能成功达到全局最优。
  • LLSFE估计器具有可证明的一致性,并能适应局部密度几何结构,在得分估计方面优于传统的基于核或k-NN的方法。
  • 经验学习曲线显示,$ \widehat{L}(A) $ 在非高斯数据上收敛更快且参数误差更低,优于 $ G(\cdot) $ 和 $ \ell_2 $-损失。
  • 该方法在全局初始化下实现全局收敛,表明所设计的 $ \widehat{L}(A) $ 的优化景观中不存在不良局部极小值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。