[论文解读] A Probabilistic Framework for Nonlinearities in Stochastic Neural Networks
该论文提出 TruG,一种基于双侧截断高斯分布的统一概率框架,将 ReLU、Sigmoid 和 Tanh 非线性激活函数统一起来,实现随机神经网络中非线性激活函数与模型权重的端到端联合学习。该框架通过允许灵活、数据驱动的非线性适应,在 RBM、时序 RBM 和 TGGM 模型中均提升了性能。
We present a probabilistic framework for nonlinearities, based on doubly truncated Gaussian distributions. By setting the truncation points appropriately, we are able to generate various types of nonlinearities within a unified framework, including sigmoid, tanh and ReLU, the most commonly used nonlinearities in neural networks. The framework readily integrates into existing stochastic neural networks (with hidden units characterized as random variables), allowing one for the first time to learn the nonlinearities alongside model weights in these networks. Extensive experiments demonstrate the performance improvements brought about by the proposed framework when integrated with the restricted Boltzmann machine (RBM), temporal RBM and the truncated Gaussian graphical model (TGGM).
研究动机与目标
- 将常用的非线性激活函数(ReLU、Sigmoid、Tanh)统一在一个适用于随机神经网络的概率框架中。
- 实现非线性激活函数与模型权重的端到端联合学习,而非在模型设计阶段固定非线性形式。
- 扩展随机神经网络(如玻尔兹曼机和信念网络)的适用性,使其能够从数据中学习非线性参数。
- 为生成模型与判别模型中的确定性激活函数提供一种统一、灵活且具有概率基础的替代方案。
提出的方法
- 将隐藏单元建模为截断高斯随机变量:$ p(h|z,\bm{\xi}) = \mathcal{N}_{[\xi_1,\xi_2]}(h|z,\sigma^2) $,其中 $ z $ 为净输入,$ \bm{\xi} = (\xi_1, \xi_2) $ 为可学习的截断点。
- 利用条件期望 $ \mathbb{E}[h|z,\bm{\xi}] $ 推导出一个确定性激活函数,该函数在合适的 $ \bm{\xi} $ 设置下可近似表示 ReLU、Sigmoid 和 Tanh。
- 通过将标准非线性激活替换为 TruG 单元,将 TruG 集成到现有随机模型中:TruG-RBM、时序 TruG-RBM 和 TruG-TGGM。
- 通过最大化 $ \bm{\xi} $ 的似然函数进行模型训练,仅对优化更新进行最小修改,即可实现单元级与模型级的非线性联合学习。
- 采用变分推断,进行 10 轮 VB 迭代以估计参数,使用自适应学习率的 RMSprop 优化器,并采用小批量训练。
- 评估固定与学习的截断点设置,包括独立(单元级)与共享(模型级)参数学习策略。
实验结果
研究问题
- RQ1能否通过截断高斯分布,将 ReLU、Sigmoid 和 Tanh 等常见非线性激活函数统一在一个概率框架中?
- RQ2能否在 RBM 和 TGGM 等随机神经网络中,实现非线性激活函数与模型权重的联合学习?
- RQ3在生成与判别模型中,学习非线性参数(即截断点)是否能显著优于固定非线性激活函数?
- RQ4不同截断点设置(如 [0,1]、[-1,1]、[0,∞))对多种数据集上的模型性能有何影响?
- RQ5TruG 框架能否在不引入显著架构或算法变更的前提下,无缝集成到现有随机模型中?
主要发现
- TruG 框架通过调节截断点 $ \xi_1 $ 和 $ \xi_2 $,成功将 ReLU、Sigmoid 和 Tanh 作为双侧截断高斯分布的特例统一表示。
- 在时序 RBM 中,采用学习截断点的 TruG-RBM 在行走任务中实现 7.3% 的错误率,跑步任务中为 5.9%,优于原始 TRBM(9.6% 和 6.8%)以及 c-Learn(6.7% 和 5.5%)。
- 在波士顿房价数据集上,TruG-TGGM 模型采用学习截断点(s-Learn)时,RMSE 达到 3.401 ± 0.375,优于基于 ReLU 的 MLP(3.228 ± 0.195)及其他 TruG 变体。
- 在 K8nm 数据集上,TruG-TGGM 模型采用学习截断点(s-Learn)时,RMSE 为 0.073 ± 0.002,显著优于基于 ReLU 的 MLP(0.091 ± 0.002)。
- 在多数数据集上,采用独立截断点学习策略(s-Learn)的 TruG-TGGM 表现优于通用学习策略(c-Learn),包括蛋白质结构数据集(4.206 ± 0.071 vs. 4.209 ± 0.073 RMSE)。
- 该框架支持在相同模型结构中灵活切换非线性激活函数,实现无需修改网络架构即可无缝替换 ReLU 为 Sigmoid 或 Tanh。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。