Skip to main content
QUICK REVIEW

[论文解读] Bayesian Tensor Network with Polynomial Complexity for Probabilistic Machine Learning

Shi-Ju Ran|arXiv (Cornell University)|Dec 30, 2019
Bayesian Modeling and Causal Inference参考文献 35被引用 4
一句话总结

该论文提出贝叶斯张量网络(BTN),一种概率机器学习模型,通过多项式复杂度高效捕捉事件集合中指数级庞大的条件概率。通过利用张量网络结构和基于旋转的优化方法,BTN在时尚-MNIST数据集上实现了具有竞争力的图像分类性能,揭示了图像识别问题中协方差的“面积定律”。

ABSTRACT

It is known that describing or calculating the conditional probabilities of multiple events is exponentially expensive. In this work, Bayesian tensor network (BTN) is proposed to efficiently capture the conditional probabilities of multiple sets of events with polynomial complexity. BTN is a directed acyclic graphical model that forms a subset of TN. To testify its validity for exponentially many events, BTN is implemented to the image recognition, where the classification is mapped to capturing the conditional probabilities in an exponentially large sample space. Competitive performance is achieved by the BTN with simple tree network structures. Analogous to the tensor network simulations of quantum systems, the validity of the simple-tree BTN implies an ``area law'' of fluctuations in image recognition problems.

研究动机与目标

  • 解决大规模概率模型中计算条件概率的指数级复杂度问题。
  • 为高维数据开发一种可扩展、高效的贝叶斯信念网络(BBN)替代方法。
  • 将张量网络技术应用于概率机器学习,结合BBN与张量网络的优势。
  • 在样本空间呈指数级庞大的图像识别任务上验证该模型。
  • 探索机器学习问题中波动的“面积定律”是否存在,类似于量子系统中的情况。

提出的方法

  • BTN被形式化为基于张量网络(TN)的有向无环图模型,通过多线性张量表示条件概率。
  • 条件概率编码在(m+1)阶张量T中,其中T_{j,i1...im} = P(y_j | x1_i1, ..., xm_im)。
  • 网络结构预先定义(例如树状结构),避免NP难的结构学习问题,并使用张量收缩而非Gibbs采样进行推理。
  • 提出一种基于旋转的优化方法以更新张量核心,避免梯度消失并提升训练稳定性。
  • 通过将像素集合映射到根张量,将模型应用于图像识别,隐藏层通过张量收缩处理特征。
  • 使用准确率作为指标,在时尚-MNIST上评估模型性能,并对深度、根维数(d)和隐藏维数(χ)进行消融研究。

实验结果

研究问题

  • RQ1张量网络能否有效用于表示指数级庞大样本空间中的条件概率?
  • RQ2贝叶斯张量网络是否在保持高准确率的同时实现多项式复杂度的概率机器学习?
  • RQ3BTN模型能否揭示图像识别中协方差的“面积定律”,类似于量子系统中的情况?
  • RQ4BTN在图像分类任务中与朴素贝叶斯和标准神经网络相比表现如何?
  • RQ5基于旋转的优化方法是否比Adam等标准方法在训练BTN模型时更有效?

主要发现

  • BTN在时尚-MNIST数据集上实现了具有竞争力的分类准确率,显著优于朴素贝叶斯分类器(约70%准确率)。
  • 模型准确率随隐藏维数χ的增加而提升,表明模型表达能力随容量增强而提升。
  • 在相同d和χ条件下,BTN 1(结构更浅)优于BTN 2(结构更深),原因在于参数复杂度更高且长程相关性的路径更短。
  • 基于旋转的优化方法在约100个周期后稳定收敛,而Adam表现出梯度消失迹象,且在未手动归一化的情况下无法达到良好性能。
  • 结果表明图像识别中存在协方差的“面积定律”,即长程相关性主要由边界附近的短程涨落主导。
  • 该模型的高效性与可扩展性表明,张量网络可为具有多项式复杂度的概率机器学习提供自然框架。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。