Skip to main content
QUICK REVIEW

[论文解读] Structured Output Learning with Conditional Generative Flows

You Lü, Bert Huang|arXiv (Cornell University)|May 30, 2019
Generative Adversarial Networks and Image Synthesis参考文献 48被引用 6
一句话总结

本文提出条件化Glow(c-Glow),一种基于归一化流的模型,可在结构化预测任务中实现精确且高效的条件似然计算 $p(y|x)$。通过利用输入条件化的耦合层实现可逆流,c-Glow 采用最大似然方法端到端训练,无需替代目标或变分推断,在包括图像分割、去噪和图像修复在内的五项多样化结构化预测任务中,实现了最先进或具有竞争力的性能。

ABSTRACT

Traditional structured prediction models try to learn the conditional likelihood, i.e., p(y|x), to capture the relationship between the structured output y and the input features x. For many models, computing the likelihood is intractable. These models are therefore hard to train, requiring the use of surrogate objectives or variational inference to approximate likelihood. In this paper, we propose conditional Glow (c-Glow), a conditional generative flow for structured output learning. C-Glow benefits from the ability of flow-based models to compute p(y|x) exactly and efficiently. Learning with c-Glow does not require a surrogate objective or performing inference during training. Once trained, we can directly and efficiently generate conditional samples. We develop a sample-based prediction method, which can use this advantage to do efficient and effective inference. In our experiments, we test c-Glow on five different tasks. C-Glow outperforms the state-of-the-art baselines in some tasks and predicts comparable outputs in the other tasks. The results show that c-Glow is versatile and is applicable to many different structured prediction problems.

研究动机与目标

  • 为解决结构化预测模型中难以计算似然的问题,该问题阻碍了有效训练与推理。
  • 开发一种条件生成模型,实现 $p(y|x)$ 的精确、高效且可微分的计算,无需依赖替代目标或近似推断。
  • 在训练后能够直接且高效地从真实条件分布 $p(y|x)$ 中采样,支持多样化且高质量的预测。
  • 在具有离散与连续输出的多样化结构化预测任务中,评估所提模型的通用性与性能。

提出的方法

  • c-Glow 通过引入基于输入的耦合层,扩展了Glow归一化流架构,使变换能够依赖于输入特征 $x$。
  • 该模型使用可逆的、类似自回归的耦合层,并通过条件网络根据 $x$ 生成耦合参数,从而利用变量变换公式实现精确的似然计算。
  • 通过变换的雅可比行列式精确计算对数似然 $\log p(y|x)$,支持直接的最大似然训练。
  • 开发了一种基于采样的预测方法,可在推理阶段高效地从学习到的分布中生成多样化的条件样本。
  • 通过调整条件网络的宽度和深度以及潜在空间维度,按任务需求适配模型架构,同时在各类任务中保持一致的框架。
  • 采用随机梯度下降端到端训练模型,以最大化给定输入的结构化输出的精确对数似然。

实验结果

研究问题

  • RQ1能否通过实现精确的条件似然计算,将基于流的模型有效适配于高维输出的结构化预测任务?
  • RQ2通过归一化流实现精确似然训练,是否在结构化预测中优于或匹配基于替代目标或变分推断的方法?
  • RQ3c-Glow 是否能在无需迭代推理过程的情况下,高效生成多样化且高质量的条件样本?
  • RQ4c-Glow 在具有不同类型输出(离散与连续)的多样化结构化预测任务中表现如何?

主要发现

  • 在深度细化任务中,c-Glow 的 PSNR 达到 36.53,略高于 ProximalNet(36.31),并显著优于基于滤波的基线方法。
  • 在图像修复任务中,c-Glow 的 PSNR 为 24.88,优于 DCGAN 图像修复(23.65)和使用泊松混合的 DCGAN(22.73)。
  • 在二值与多类别分割任务中,c-Glow 的性能与最先进的深度结构化预测模型(如 DVN 和 NLStruct)相当或更优。
  • c-Glow 在五项不同任务(分割、去噪、图像修复)中表现出强大的泛化能力,仅使用单一架构并辅以极少的超参数调优。
  • 尽管在去噪任务中的 PSNR 略低于 BM3D 和 DnCNN,但 c-Glow 生成的结果在结构准确性方面更优,尤其在图像修复中更有效地保留了面部特征。
  • 该模型能够直接从学习到的分布中生成多样化且高质量的样本,凸显其在条件生成方面相对于 CRF 或能量模型中迭代推理方法的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。