Skip to main content
QUICK REVIEW

[论文解读] Wasserstein Iterative Networks for Barycenter Estimation

Alexander Korotin, Vage Egiazarian|arXiv (Cornell University)|Jan 28, 2022
Aesthetic Perception and Analysis被引用 4
一句话总结

该论文提出了一种新颖的、无偏见的算法,用于使用迭代固定点优化和生成神经网络求解器,估计连续概率测度的Wasserstein-2中位数。与依赖正则化或输入凸神经网络的先前方法不同,该方法允许使用任意架构,并引入了Ave, celeba!数据集用于大规模评估,在图像生成任务中实现了最先进的FID分数。

ABSTRACT

Wasserstein barycenters have become popular due to their ability to represent the average of probability measures in a geometrically meaningful way. In this paper, we present an algorithm to approximate the Wasserstein-2 barycenters of continuous measures via a generative model. Previous approaches rely on regularization (entropic/quadratic) which introduces bias or on input convex neural networks which are not expressive enough for large-scale tasks. In contrast, our algorithm does not introduce bias and allows using arbitrary neural networks. In addition, based on the celebrity faces dataset, we construct Ave, celeba! dataset which can be used for quantitative evaluation of barycenter algorithms by using standard metrics of generative models such as FID.

研究动机与目标

  • 开发一种可扩展的、无偏见的算法,用于计算连续概率测度的Wasserstein-2中位数。
  • 克服基于正则化的方法(例如熵正则化或二次正则化)在中位数估计中引入偏见的局限性。
  • 使在中位数估计中使用表达能力强、非凸的神经网络成为可能,突破输入凸神经网络(ICNNs)的限制。
  • 构建一个大规模、高维的基准数据集——Ave, celeba!——用于中位数算法的定量评估。
  • 通过在真实世界图像分布上进行标准化评估,提升最优传输研究的透明度和可复现性。

提出的方法

  • 该方法基于Alvarez等人(2016)的理论框架,采用基于固定点的迭代方案,将中位数计算重新表述为一个固定点问题。
  • 使用由神经网络参数化的生成模型 $ G_{\xi} $ 来表示随时间演化的测度 $ \mathbb{P}_{\xi} $,该测度通过迭代更新以逼近中位数。
  • 通过神经网络最优传输求解器计算输入测度与演化测度之间的最优传输映射,从而实现对中位数目标的基于梯度的优化。
  • 通过交替优化实现中位数目标的最小化:在固定点循环中依次更新传输映射和生成器网络。
  • 该方法不对生成器施加凸性约束,从而允许使用超越ICNNs的一般且表达能力强的架构。
  • Ave, celeba!数据集通过在干净人脸图像上应用退化操作(去色、随机反射、置换)构建,生成三个子集,其已知中位数为原始干净图像。

实验结果

研究问题

  • RQ1是否能够通过使用通用神经网络生成器的固定点迭代算法,在不使用熵正则化或二次正则化的情况下,实现无偏见的Wasserstein-2中位数估计?
  • RQ2在中位数估计任务中,非凸且表达能力强的生成器与输入凸神经网络相比表现如何?
  • RQ3能否构建一个大规模、高维的基准数据集,用于中位数算法的定量评估,并提供已知的真实中位数?
  • RQ4该方法在作为生成模型时,其性能在标准指标(如FID)下有多强竞争力?
  • RQ5该方法是否能通过学习中位数处的传输映射,实现跨域图像转换?

主要发现

  • 当用作生成模型时,所提出的算法在CelebA数据集上实现了最先进的FID分数,与近期基于WGAN的模型相当。
  • 该方法成功计算了Ave, celeba!数据集中64×64 RGB人脸图像的中位数,其中位数对应于原始干净图像,证明了其准确恢复能力。
  • 在MNIST和Fashion-MNIST数据集上,该算法计算了数字类别(如0和1)的中位数,其视觉效果与输入数字的像素平均值一致,证实了几何一致性。
  • 该算法通过将图像推送通过中位数,生成了合理的跨域图像(如橙色鞋子和包),展示了其在风格迁移和数据转换中的实用性。
  • Ave, celeba!数据集使得中位数算法的大规模定量评估成为可能,退化人脸子集的中位数能够恢复原始干净人脸,提供了可靠的基准。
  • 该方法无需使用可逆或归一化流即可保持绝对连续性,实证结果表明,标准GAN风格的生成器在实践中已足够。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。