[论文解读] Neural networks are a priori biased towards Boolean functions with low entropy
本文证明,具有随机权重初始化的单层感知机表现出对低熵布尔函数的强烈先验偏好——具体而言,对于所有 t < 2^n,将 t 个输入分类为 1 的函数生成概率恒为 2^(-n)。当添加 ReLU 层时,这种对低熵函数的内在偏好会单调增强,揭示了神经网络中一种基本的归纳偏差,可能解释了其在过参数化设置下的泛化能力。
Understanding the inductive bias of neural networks is critical to explaining their ability to generalise. Here, for one of the simplest neural networks -- a single-layer perceptron with n input neurons, one output neuron, and no threshold bias term -- we prove that upon random initialisation of weights, the a priori probability $P(t)$ that it represents a Boolean function that classifies t points in ${0,1}^n$ as 1 has a remarkably simple form: $P(t) = 2^{-n}$ for $0\leq t < 2^n$. Since a perceptron can express far fewer Boolean functions with small or large values of t (low entropy) than with intermediate values of t (high entropy) there is, on average, a strong intrinsic a-priori bias towards individual functions with low entropy. Furthermore, within a class of functions with fixed t, we often observe a further intrinsic bias towards functions of lower complexity. Finally, we prove that, regardless of the distribution of inputs, the bias towards low entropy becomes monotonically stronger upon adding ReLU layers, and empirically show that increasing the variance of the bias term has a similar effect.
研究动机与目标
- 通过分析初始化时函数上的先验概率分布,理解神经网络的归纳偏差。
- 研究尽管存在过参数化,深度神经网络为何能良好泛化,重点关注参数-函数映射。
- 量化架构选择(如添加 ReLU 层或调整偏置方差)对低熵函数偏好影响的程度。
- 探讨该偏好在类别不平衡设置下的影响,其中低熵函数可能更契合罕见类别检测。
提出的方法
- 推导出在随机权重初始化下,单层感知机表示将 t 个输入分类为 1 的布尔函数的精确先验概率 P(t) = 2^(-n)。
- 运用几何与组合论证表明,低 t(低熵)函数的数量远少于中间 t 函数,但由于 P(t) 的均匀性,它们在先验上同样可能。
- 证明添加 ReLU 层会单调增强对低熵函数的偏好,且该结论与输入分布无关。
- 通过实验研究偏置项方差对熵偏置的影响,结果表明增大方差会增强对低熵函数的偏好。
- 在 MNIST 和 EMNIST 上进行实验,通过偏置项偏移调节初始函数熵,测量测试准确率与敏感性。
- 应用高斯过程近似研究深层网络中的函数空间偏置,观察到与理论发现一致的标度行为。
实验结果
研究问题
- RQ1对于随机初始化的单层感知机,其布尔函数上的先验概率分布是什么?
- RQ2尽管此类函数在组合上极为稀少,为何神经网络仍表现出对低熵函数的强烈归纳偏好?
- RQ3添加 ReLU 层如何影响对低熵函数的归纳偏好?
- RQ4通过调节偏置项方差或偏移偏置项,能在多大程度上影响网络初始函数空间的偏好及其后续学习性能?
- RQ5该熵偏置如何影响类别不平衡分类任务中的学习表现?
主要发现
- 单层感知机将 t 个输入分类为 1 的先验概率 P(t) 对所有 t ∈ [0, 2^n) 恰好为 2^(-n),表明所有可能的 t 值在先验上具有相同的概率。
- 尽管数量上呈指数级稀少,低熵函数(t 较小或较大)由于 P(t) 的均匀分布,其先验概率反而高于中等熵函数。
- 添加 ReLU 层会单调增强对低熵函数的偏好,且该结论已通过解析方法证明,与输入分布无关。
- 实验结果表明,增大偏置项方差会增强对低熵函数的偏好,表明该偏好具有可调性。
- 在 MNIST 和 EMNIST 等类别不平衡数据集上,通过偏置项偏移提升初始函数熵(t)可提高测试准确率与敏感性,尤其在使用 ReLU 激活的全连接网络中表现显著。
- 对准确率与敏感性最优的偏移超参数与真实类别不平衡比(如 MNIST 的 1:10)一致,表明调节偏置可使归纳偏好与目标函数对齐。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。