Skip to main content
QUICK REVIEW

[论文解读] Tensorial Mixture Models

Or Sharir, Ronen Tamari|arXiv (Cornell University)|Oct 13, 2016
Bayesian Methods and Mixture Models参考文献 41被引用 17
一句话总结

本文提出了张量混合模型(TMMs),一种可 tractable 的生成模型,结合卷积神经网络结构与张量分析,实现对缺失数据的高效、精确的边缘化。TMMs 通过利用可 tractable 推断和通过局部块建模与专家混合层控制的表达能力,在缺失数据下的分类任务中实现了最先进性能。

ABSTRACT

Casting neural networks in generative frameworks is a highly sought-after endeavor these days. Contemporary methods, such as Generative Adversarial Networks, capture some of the generative capabilities, but not all. In particular, they lack the ability of tractable marginalization, and thus are not suitable for many tasks. Other methods, based on arithmetic circuits and sum-product networks, do allow tractable marginalization, but their performance is challenged by the need to learn the structure of a circuit. Building on the tractability of arithmetic circuits, we leverage concepts from tensor analysis, and derive a family of generative models we call Tensorial Mixture Models (TMMs). TMMs assume a simple convolutional network structure, and in addition, lend themselves to theoretical analyses that allow comprehensive understanding of the relation between their structure and their expressive properties. We thus obtain a generative model that is tractable on one hand, and on the other hand, allows effective representation of rich distributions in an easily controlled manner. These two capabilities are brought together in the task of classification under missing data, where TMMs deliver state of the art accuracies with seamless implementation and design.

研究动机与目标

  • 开发一种结合深度网络表达能力与算术电路可 tractable 性的生成模型。
  • 实现对缺失输入的精确且高效的边缘化,这对于不完整数据下的鲁棒分类至关重要。
  • 通过张量分析克服现有模型的局限性——如可扩展性差、结构僵化或缺乏可 tractable 推断——以提升性能。
  • 提供一个理论基础坚实的框架,将模型结构与高维分布中的表达能力联系起来。
  • 在缺失数据分类任务中展示卓越性能,特别是在非忽略性缺失机制下。

提出的方法

  • TMMs 将高维数据建模为一系列局部块,假设每个块遵循具有跨空间位置共享参数的混合成分。
  • 该模型采用卷积结构,其中每个空间位置应用一个专家混合(MEX)层,以计算成分密度的凸组合。
  • 一个关键创新是:在 MEX 操作前使用激活归一化:对每个空间位置应用软最大归一化,从激活中减去归一化值,然后在 MEX 后重新加上,从而在不改变输出的前提下提高数值稳定性。
  • 通过将缺失像素视为未观测变量,模型实现可 tractable 的边缘化,从而通过求和所有可能补全方式,精确计算类别概率。
  • 在推理阶段,模型对输入图像的多个平移版本进行应用,缺失区域被掩码,预测结果取平均以提升鲁棒性。
  • 该架构通过交叉熵损失端到端训练,超参数如温度 β 根据数据集进行调优(例如,MNIST 使用 β=0.01,NORB 使用不同值)。

实验结果

研究问题

  • RQ1基于神经网络的生成模型能否在复杂数据分布上同时实现可 tractable 边缘化与高表达能力?
  • RQ2如何利用张量分析设计一族既理论可解释又实际有效的生成模型?
  • RQ3TMMs 在缺失数据分类任务中,特别是在非忽略性缺失机制下,能在多大程度上超越判别模型?
  • RQ4使用归一化专家混合层是否能在不损害可 tractable 性的前提下,提升 TMMs 的训练稳定性和泛化能力?
  • RQ5能否将通过平移和边缘化的数据增强无缝集成到 TMMs 中,以提升对缺失输入的鲁棒性?

主要发现

  • 在 MNIST 上进行特征删除的二值数字分类任务中,TMMs 实现了最先进准确率,即使在标准 ConvNets 经过模拟缺失性训练后,仍表现更优。
  • 在 MNIST 多分类任务中,TMMs 在各种缺失模式下保持高性能,包括 i.i.d. 像素损坏和缺失矩形区域,且在测试阶段无需了解缺失机制。
  • MEX 层中使用激活归一化显著提升了数值稳定性与模型性能,尤其在处理大激活值时效果明显。
  • TMMs 对未见缺失分布具有良好的泛化能力:在一种类型损坏(如 i.i.d.)上训练后,对其他类型(如矩形缺失)也表现良好,体现出鲁棒性。
  • 模型通过边缘化缺失像素而无需裁剪或插补,实现了稳定的性能提升,尤其在高缺失水平下(如 N=150 个非零像素被删除)。
  • 实验表明,基于模拟缺失分布训练的标准 ConvNets 在面对未见缺失类型时会产生偏差且性能下降,凸显了 TMMs 内在边缘化能力的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。