Skip to main content
QUICK REVIEW

[论文解读] Generative Models as Distributions of Functions

Emilien Dupont, Yee Whye Teh|arXiv (Cornell University)|Feb 9, 2021
Image Processing and 3D Reconstruction参考文献 72被引用 13
一句话总结

该论文提出了一种生成建模框架,将数据视为连续函数而非离散网格,通过神经网络函数的概率分布实现与分辨率无关的学习。通过使用超网络和基于连续空间判别器的对抗性训练,该模型能够在不依赖网格分辨率或离散化的情况下,生成跨多种数据类型(包括图像、3D形状和气候数据)的高质量、清晰样本。

ABSTRACT

Generative models are typically trained on grid-like data such as images. As a result, the size of these models usually scales directly with the underlying grid resolution. In this paper, we abandon discretized grids and instead parameterize individual data points by continuous functions. We then build generative models by learning distributions over such functions. By treating data points as functions, we can abstract away from the specific type of data we train on and construct models that are agnostic to discretization. To train our model, we use an adversarial approach with a discriminator that acts on continuous signals. Through experiments on a wide variety of data modalities including images, 3D shapes and climate data, we demonstrate that our model can learn rich distributions of functions independently of data type and resolution.

研究动机与目标

  • 解决生成建模中的离散化困境,即模型大小和训练成本随网格分辨率增加而增长,尤其是在3D场景中。
  • 克服基于网格的表示方式(如图像作为2D数组、体素作为3D网格)带来的可扩展性和分辨率独立性限制。
  • 开发一种统一的生成建模框架,以连续函数为基础,与数据类型或分辨率无关。
  • 利用隐式神经表示实现复杂、高频信号(如清晰图像、细节丰富的3D形状)的高保真生成。
  • 使用相同的训练流程,训练单一模型架构,以学习多样数据模态中丰富且平滑的函数分布。

提出的方法

  • 将每个数据点表示为连续函数 $ f_\theta: \mathbb{R}^d \to \mathbb{R}^k $,由神经网络参数 $ \theta $ 参数化,使用基于坐标的编码(如随机傅里叶特征)来建模高频信号。
  • 通过超网络参数化函数网络的权重 $ \theta $,将生成过程建模为函数的概率分布,从而实现多样化函数的随机生成。
  • 采用对抗性训练框架,其中判别器直接作用于坐标-特征对集合 $ \{ (\mathbf{x}_i, \mathbf{y}_i) \} $,将其视为连续信号而非离散网格。
  • 使用基于集合的判别器,采用对称且排列不变的架构,从局部编码计算全局得分,确保对输入顺序的不变性,并支持不同点数的泛化。
  • 利用随机傅里叶特征(RFF)提升对信号中高频分量的建模能力,缓解标准MLP对低频函数的偏差。
  • 通过理论分析约束判别器的Lipschitz常数,确保训练稳定性,从而实现连续函数空间上可靠的GAN训练。

实验结果

研究问题

  • RQ1能否训练生成模型以学习与底层数据分辨率或网格结构无关的连续函数分布?
  • RQ2能否使用同一套训练流程,使单一模型架构在图像、3D形状和气候数据等多种数据模态上生成高质量、清晰的样本?
  • RQ3与基于网格的GAN相比,基于连续坐标-特征集合的对抗性训练是否在样本质量与分辨率独立性方面表现更优或泛化能力更强?
  • RQ4结合RFF编码的隐式神经表示能否有效建模生成建模中的高频信号,从而实现清晰逼真的样本生成?
  • RQ5该模型是否学习到一个平滑、可插值的潜在空间,能够反映数据流形中具有意义的变化,即使在不同数据类型之间也成立?

主要发现

  • 所提出的模型GASP在图像(CelebAHQ、MNIST)、3D形状(ShapeNet)和气候数据(ERA5)上均能生成高保真、清晰的样本,其视觉质量与真实数据相当或更优。
  • 模型实现了与分辨率无关的生成:在低分辨率图像(64×64)上进行训练后,无需微调即可实现高达512×512的超分辨率生成。
  • 在函数空间中的潜在空间插值可产生平滑、连贯的样本过渡,表明模型学习到了有意义且连续的数据流形。
  • 通过直方图对比验证,生成的气候数据(如温度)分布与真实测试集分布高度一致,表明模型实现了忠实的分布学习。
  • 模型具备跨数据类型的泛化能力:相同的架构和训练设置可成功学习图像、3D形状和2D气候场的分布,无需修改网络结构。
  • 随机傅里叶特征的使用有效提升了高频分量的建模能力,使模型能够生成标准隐式表示难以捕捉的清晰纹理和精细细节。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。