[论文解读] Deep Learning and Hierarchal Generative Models
本文提出一种简单的生成式层次模型,其中深度学习在半监督分类中既必要又高效。证明了仅依赖局部或浅层特征的算法——受限于低阶统计量或局部特征——无法有效分类未标记数据,而利用完整数据相关性的深度算法可实现完美标注,从而证明此类模型中深度的理论必要性。
It is argued that deep learning is efficient for data that is generated from hierarchal generative models. Examples of such generative models include wavelet scattering networks, functions of compositional structure, and deep rendering models. Unfortunately so far, for all such models, it is either not rigorously known that they can be learned efficiently, or it is not known that "deep algorithms" are required in order to learn them. We propose a simple family of "generative hierarchal models" which can be efficiently learned and where "deep" algorithm are necessary for learning. Our definition of "deep" algorithms is based on the empirical observation that deep nets necessarily use correlations between features. More formally, we show that in a semi-supervised setting, given access to low-order moments of the labeled data and all of the unlabeled data, it is information theoretically impossible to perform classification while at the same time there is an efficient algorithm, that given all labelled and unlabeled data, perfectly labels all unlabelled data with high probability. For the proof, we use and strengthen the fact that Belief Propagation does not admit a good approximation in terms of linear functions.
研究动机与目标
- 正式化深度学习在学习层次生成过程数据方面表现优异的假设。
- 构建一个数学上可处理的生成模型,使深度学习在其中被严格证明为必要,而不仅有效。
- 利用信息论界 bounds 展示浅层和局部算法在半监督设置中的局限性。
- 建立深度学习成功与高阶特征相关性利用之间的正式联系。
- 通过引入标签、特征排列和特征交互,扩展系统发育树模型,以更好地反映深度学习的动力学。
提出的方法
- 在带有标签节点的树上引入对称马尔可夫模型,其中每个节点具有标签和表示(例如DNA序列)。
- 通过父节点与子节点之间的特征排列来建模特征演化,以反映深度网络中的表示变化。
- 将局部算法定义为仅使用标记数据独立标注每个点,而不使用全局相关性。
- 将浅层算法定义为仅限于标记数据的有界阶统计量,排除高阶特征相关性。
- 使用信念传播和鲁棒重构理论证明,当深度较大时,标记数据数量几乎与根标签无关。
- 应用重建误差的指数衰减界(通过引理8.1)证明,压缩后的标记数据对未标记数据几乎不具信息量。
实验结果
研究问题
- RQ1我们能否构建一个生成模型,使得深度学习在高效半监督分类中被严格证明为必要?
- RQ2浅层和局部算法在层次模型中因无法捕捉高阶特征相关性而失效的程度如何?
- RQ3重建误差随深度呈指数衰减如何影响层次模型的可学习性?
- RQ4我们能否通过严谨的生成模型形式化深度网络通过利用特征间相关性而成功的思想?
- RQ5在树结构中引入特征排列和标签传播是否会导致深度与浅层学习算法之间的分离?
主要发现
- 在所提出的层次模型中,由于压缩后的标记数据与根标签在信息论上独立,局部算法的误差率至少为 $M^{-1}$,即无法优于随机猜测。
- 浅层算法受限于有界阶统计量,被严格证明无效,因为当深度 $h$ 较大时,标记数据计数的分布几乎与真实根标签无关。
- 本文建立了重建误差的指数衰减:$\eta \leq C \exp(-ch)$,其中 $\eta$ 衡量分布与标签无关性的偏离程度,表明标记数据随深度渐近趋于无信息量。
- 存在一种高效的深度算法,能利用所有标记和未标记数据,以高概率完美标注所有未标记数据,从而证明深度在效率上的必要性。
- 该模型表明,信念传播无法被线性函数良好近似,进一步强化了对层次化、深度架构的需求。
- 该结果适用于一类满足 $d\lambda^2 < 1$ 的模型,包括 $k$-字母表模型,推广了先前关于计数重构的结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。