[论文解读] Learning Autoencoders with Relational Regularization
本文提出了一种关系正则化自编码器(RAE),利用融合的格罗莫夫-瓦瑟斯坦(FGW)距离,在自编码器中学习结构化、可学习的先验分布,从而提升生成性能,并实现具有不可比潜在空间的异构自编码器的联合训练。该方法在图像生成任务中优于变分自编码器(VAE)、WAE及其变体,并在多视图学习任务中达到最先进性能。
A new algorithmic framework is proposed for learning autoencoders of data distributions. We minimize the discrepancy between the model and target distributions, with a \emph{relational regularization} on the learnable latent prior. This regularization penalizes the fused Gromov-Wasserstein (FGW) distance between the latent prior and its corresponding posterior, allowing one to flexibly learn a structured prior distribution associated with the generative model. Moreover, it helps co-training of multiple autoencoders even if they have heterogeneous architectures and incomparable latent spaces. We implement the framework with two scalable algorithms, making it applicable for both probabilistic and deterministic autoencoders. Our relational regularized autoencoder (RAE) outperforms existing methods, $e.g.$, the variational autoencoder, Wasserstein autoencoder, and their variants, on generating images. Additionally, our relational co-training strategy for autoencoders achieves encouraging results in both synthesis and real-world multi-view learning tasks. The code is at https://github.com/HongtengXu/ Relational-AutoEncoders.
研究动机与目标
- 解决因固定或指定不当的先验分布而导致自编码器出现过正则化和欠正则化的问题。
- 在多视图学习中,实现具有异构架构和不可比潜在空间的自编码器的有效联合训练。
- 开发一种灵活的关系正则化框架,以捕捉先验分布与后验分布之间的结构差异。
- 通过学习结构化、数据驱动的先验分布,而非固定分布(如标准高斯分布),提升生成建模性能。
- 通过利用潜在表示之间的关系约束,将自编码器的适用范围扩展到未配对的多视图数据。
提出的方法
- 提出一种基于融合的格罗莫夫-瓦瑟斯坦(FGW)距离的关系正则化器,用于比较先验分布与后验分布中样本之间的结构关系。
- 利用FGW距离正则化可学习潜在先验与从编码数据中推导出的后验分布之间的差异,从而实现结构化先验学习。
- 应用FGW的分层和切片近似方法,使该方法可扩展至概率性和确定性自编码器。
- 通过对其后验分布应用关系正则化,实现不同架构和潜在空间维度的多个自编码器的联合训练。
- 实现两种可扩展的算法:一种用于分层FGW,另一种用于切片FGW,确保计算效率。
- 利用松弛的瓦瑟斯坦距离最小化目标,结合重建损失与关系正则化,以训练自编码器。
实验结果
研究问题
- RQ1基于FGW距离的关系正则化器是否能通过学习结构化先验,提升自编码器中生成建模的质量?
- RQ2所提出的關係正則化是否能缓解具有可学习先验的自编码器中的欠正则化与过正则化问题?
- RQ3能否通过其后验分布之间的关系约束,有效联合训练具有不兼容潜在空间的异构自编码器?
- RQ4与现有基线相比,该关系联合训练策略在未配对多视图学习任务中的表现如何?
- RQ5关系正则化器对多视图设置下图像生成质量与下游分类准确率有何影响?
主要发现
- 关系正则化自编码器(RAE)在图像生成方面优于VAE、WAE及其变体,生成的样本更具多样性且语义更合理。
- 该方法成功学习到结构化、数据驱动的先验分布,有效抑制了欠正则化,提升了生成质量,且无需依赖固定的高斯先验。
- 在多视图学习任务中,所提出的联合训练策略(AEs+GW)在Caltech101-7数据集上达到84.29%的准确率,优于基线方法如AEs+CoReg(76.58%)和AEs+CCA(80.24%)。
- 在Caltech101-20数据集上达到69.39%的准确率,在Handwritten数据集上达到72.36%,在所有数据集中均超越所有对比基线。
- 即使在未配对数据下,该关系联合训练框架依然有效,并适用于不同架构和潜在空间维度的自编码器。
- 分层与切片FGW近似为在概率性和确定性自编码器中实现关系正则化提供了一种可扩展且高效的方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。