Skip to main content
QUICK REVIEW

[论文解读] Approximation capability of neural networks on spaces of probability measures and tree-structured domains

Tomáš Pevný, Vojtěch Kovařík|arXiv (Cornell University)|Jun 3, 2019
Neural Networks and Applications参考文献 27被引用 11
一句话总结

本文建立了神经网络在概率测度的紧集以及树状结构数据域(如JSON、XML和ProtoBuf)上函数的通用近似性质。证明了采用均值聚合的两分支神经网络可近似任意连续函数于概率测度上,将通用近似定理扩展至多实例学习和层次化数据格式。

ABSTRACT

This paper extends the proof of density of neural networks in the space of continuous (or even measurable) functions on Euclidean spaces to functions on compact sets of probability measures. By doing so the work parallels a more then a decade old results on mean-map embedding of probability measures in reproducing kernel Hilbert spaces. The work has wide practical consequences for multi-instance learning, where it theoretically justifies some recently proposed constructions. The result is then extended to Cartesian products, yielding universal approximation theorem for tree-structured domains, which naturally occur in data-exchange formats like JSON, XML, YAML, AVRO, and ProtoBuffer. This has important practical implications, as it enables to automatically create an architecture of neural networks for processing structured data (AutoML paradigms), as demonstrated by an accompanied library for JSON format.

研究动机与目标

  • 将神经网络的通用近似定理扩展至紧集上的概率测度上的连续函数。
  • 正式证明多实例学习(MIL)神经网络架构的合理性,该架构通过在可变大小的实例包上进行均值池化来聚合特征。
  • 通过递归应用概率测度结果,将近似能力推广至树状结构数据域,如JSON和XML。
  • 为近期用于结构化数据处理的神经网络架构(包括嵌套集合和层次模式)提供理论基础。
  • 通过证明神经网络在概率测度上连续函数空间中的稠密性,将核均值嵌入技术与深度学习相连接。

提出的方法

  • 使用Stone-Weierstrass定理,证明具有两个非线性隐藏层和线性输出层的神经网络在紧集上概率测度的连续函数空间中是稠密的。
  • 在第一个网络分支后应用均值聚合(即逐元素平均),以处理可变大小的实例包,确保排列不变性。
  • 通过递归应用概率测度近似结果于紧度量空间的笛卡尔积,将结果扩展至树状结构域。
  • 定义一类空间S,其在有限笛卡尔积运算和概率测度空间构造下封闭,以确保递归适用性。
  • 在概率测度空间上使用度量ρ*,以确保逼近过程的拓扑一致性和连续性。
  • 利用核方法中的均值映射嵌入概念,将其适配至前馈神经网络,以证明在新领域中的通用近似性。

实验结果

研究问题

  • RQ1神经网络是否能像在欧氏空间中那样,对紧集上的概率测度上的连续函数实现通用近似?
  • RQ2标准的MIL神经网络架构——两个网络分支配合均值聚合——是否对概率测度上的函数具有通用近似能力?
  • RQ3通用近似性质能否扩展至自然表示为层次化和可变大小数据的树状结构数据格式(如JSON和XML)?
  • RQ4在再生核Hilbert空间中,均值映射嵌入的理论基础是否可推广至具有类似不变性和近似性质的神经网络架构?
  • RQ5该近似结果能否推广至可测函数?对激活函数的最小连续性假设是什么?

主要发现

  • 本文证明,具有两个非线性层、一个均值聚合层和一个线性输出层的神经网络,在紧集上概率测度的连续函数空间中是稠密的(定理2)。
  • 通过递归应用,该结果被扩展至树状结构域,表明神经网络在属于类S的任意空间上的连续函数中都是稠密的,该类S包括R^d的所有紧子集及其有限乘积和概率测度(定理5)。
  • 该证明依赖于Stone-Weierstrass定理,适用于连续激活函数,且非线性函数仅需在最后一层外保持连续。
  • 该理论框架为MIL神经网络在点云处理、医学诊断和网络入侵检测等应用中的广泛应用提供了理论依据。
  • 该工作为结构化数据上的AutoML架构提供了正式基础,并附带一个库,展示了针对类似JSON格式的神经网络构建方法。
  • 该结果将核均值嵌入和最大均值差异方法推广至神经网络,为基于核的方法提供了一种可扩展的替代方案,复杂度为O(l³b²)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。