[论文解读] Consistent estimation of the architecture of multilayer perceptrons
该论文证明了在存在高斯噪声的单隐层多层感知机(MLP)架构选择中,即使由于参数不可识别性导致费雪信息矩阵奇异,贝克信息准则(BIC)等信息准则仍具有理论一致性。通过将模型重新参数化以分离可识别与不可识别成分,并应用Gassiat及Liu & Shao的最新渐近理论,证明了在有界参数约束下,似然比统计量保持有界性,从而确保随着样本量增大,BIC能一致地选择出真实的隐藏单元数量。
We consider regression models involving multilayer perceptrons (MLP) with one hidden layer and a Gaussian noise. The estimation of the parameters of the MLP can be done by maximizing the likelihood of the model. In this framework, it is difficult to determine the true number of hidden units using an information criterion, like the Bayesian information criteria (BIC), because the information matrix of Fisher is not invertible if the number of hidden units is overestimated. Indeed, the classical theoretical justification of information criteria relies entirely on the invertibility of this matrix. However, using recent methodology introduced to deal with models with a loss of identifiability, we prove that suitable information criterion leads to consistent estimation of the true number of hidden units.
研究动机与目标
- 解决在费雪信息矩阵因参数不可识别性而奇异时,BIC等信息准则在选择多层感知机架构时的理论不一致性问题。
- 建立经典信息准则在过参数化情况下仍保持一致的充分条件,以用于MLP模型选择。
- 通过提供其一致性的严格渐近基础,为实践中使用惩罚似然方法(如BIC)提供理论支持。
- 将近期针对非正则模型的渐近理论扩展至具有有界参数的前馈神经网络情境。
- 证明在有界参数约束下,似然比统计量保持有界性,从而实现BIC的收敛性。
提出的方法
- 通过基于真实隐藏单元数量 $k^0$ 的分组方案,将MLP模型重新参数化,以分离等价参数的可识别与不可识别部分。
- 引入参数化 $\theta = (\Phi_t, \psi_t)$,其中 $\Phi_t$ 捕获可识别部分,$\psi_t$ 捕获不可识别部分,确保仅当 $\Phi_t = \Phi_t^0$ 时,$F_{(\Phi_t^0, \psi_t)} = F_{\theta^0}$。
- 利用真实参数附近的对数似然函数的泰勒展开,推导出似然比统计量的渐近展开,依赖于激活函数 $\phi$ 的有界性与光滑性假设。
- 应用Donsker类条件,证明由 $\Phi_t$ 索引的得分函数构成Donsker类,从而实现经验过程的弱收敛。
- 应用Gassiat(2002)的定理,得出在有界参数约束下,似然比统计量保持有界性,从而意味着BIC的一致性。
- 证明覆盖得分函数类所需的最小 $\epsilon$-带数为 $O(\epsilon^{-3k^0})$,从而确认Donsker性质。
实验结果
研究问题
- RQ1当费雪信息矩阵因过参数化而奇异时,BIC等信息准则是否能一致估计多层感知机中真实的隐藏单元数量?
- RQ2在如过参数化MLP等非正则模型中,似然比统计量在何种条件下仍保持有界性?
- RQ3当真实参数位于由不可识别性导致的低维子流形上时,BIC的经典解释是否仍适用于MLP?
- RQ4近期针对非正则模型的渐近理论是否可被调整,以提供前馈神经网络中惩罚似然模型选择的理论基础?
- RQ5在过拟合MLP的情境下,有界参数空间是否能恢复信息准则(如BIC)的一致性?
主要发现
- 当参数被限制在紧集内时,BIC准则在单隐层MLP中一致地选择出真实的隐藏单元数量。
- 即使由于不可识别性导致费雪信息矩阵奇异,似然比统计量在有界参数约束下仍保持有界性。
- 由参数向量可识别部分索引的得分函数类构成Donsker类,这对弱收敛性和似然比的渐近正态性至关重要。
- 覆盖得分函数类所需的最小 $\epsilon$-带数增长为 $O(\epsilon^{-3k^0})$,从而确认Donsker性质,并支持渐近理论。
- 重新参数化方法成功分离了可识别与不可识别成分,使得先进渐近工具可应用于非正则模型。
- 本研究首次为BIC及类似惩罚似然准则在MLP架构选择中的广泛经验成功提供了理论依据。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。