Skip to main content
QUICK REVIEW

[论文解读] Autoregressive Models: What Are They Good For?

Murtaza Dalal, Alexander C. Li|arXiv (Cornell University)|Oct 17, 2019
Generative Adversarial Networks and Image Synthesis参考文献 14被引用 11
一句话总结

本文研究了自回归(AR)模型作为生成模型在下游任务中作为密度估计器的效用,发现尽管其在压缩任务中实现了最先进水平的对数似然分数,但这些分数与感知质量或任务性能之间并无相关性。尽管在CIFAR-10上实现了极低的负对数似然(例如2.85 bits/dim),AR模型在图像翻译(ARCycle)中作为学习信号,以及作为异常检测器时均表现失败,产生退化输出并错误地将非CIFAR图像分类为真实图像。

ABSTRACT

Autoregressive (AR) models have become a popular tool for unsupervised learning, achieving state-of-the-art log likelihood estimates. We investigate the use of AR models as density estimators in two settings -- as a learning signal for image translation, and as an outlier detector -- and find that these density estimates are much less reliable than previously thought. We examine the underlying optimization issues from both an empirical and theoretical perspective, and provide a toy example that illustrates the problem. Overwhelmingly, we find that density estimates do not correlate with perceptual quality and are unhelpful for downstream tasks.

研究动机与目标

  • 评估自回归模型的高对数似然估计是否在压缩之外的下游任务中具有实用性。
  • 调查AR密度估计在图像到图像翻译中作为学习信号的可靠性。
  • 评估AR模型在高维数据(如图像)中作为异常检测器的性能。
  • 诊断导致AR模型收敛到退化解的优化失败问题,尽管其负对数似然分数表现良好。
  • 挑战生成建模中低负对数似然即代表感知质量或泛化能力的假设。

提出的方法

  • 提出ARCycle,一种结合循环一致性损失与预训练AR模型(PixelCNN++)的负对数似然(NLL)的训练目标,用于指导图像翻译。
  • 在彩色MNIST和CIFAR-10上训练ARCycle,使用NLL作为判别器网络的监督信号。
  • 使用三种基于AR的阈值评估异常检测:CIFAR-10训练数据上NLL均值的1SD、2SD及单侧区间。
  • 将基于AR的异常检测方法与基于深度特征和高斯建模的基线方法(类条件高斯分布,CCG)进行比较。
  • 在CIFAR-10上训练分类器(Inception-v1),提取特征表示,并为异常检测拟合类条件高斯分布。
  • 使用bits/dim作为NLL指标,评估AR模型在包括SVHN、噪声和全黑/全白图像在内的多样化测试集上的得分。

实验结果

研究问题

  • RQ1自回归模型的对数似然分数能否作为无监督图像翻译中可靠的训练信号?
  • RQ2AR模型的高对数似然估计是否与生成图像的感知质量或真实感相关?
  • RQ3AR模型能否有效检测高维图像数据(如SVHN或随机噪声)中的异常?
  • RQ4为何AR模型在训练过程中尽管负对数似然分数很低,仍会收敛到退化解?
  • RQ5在真实世界图像分布偏移情况下,AR模型的密度估计与CCG等替代异常检测方法相比如何?

主要发现

  • ARCycle结合了NLL与循环一致性,尽管NLL低至3 bits/dim,仍会在MNIST空间中生成线状图案,表明其未能学习到真实数字的生成方式。
  • 真实CIFAR-10测试图像的NLL为2.92 bits/dim,而WGAN-GP生成的图像NLL更低(6.52 bits/dim),表明低NLL与感知质量之间无相关性。
  • AR模型对SVHN图像的对数似然更高(NLL为2.1 bits/dim),低于真实CIFAR-10图像(2.92 bits/dim),导致90.9%的时间将SVHN图像误判为CIFAR-10分布内数据。
  • 全黑和全白图像的NLL得分分别为0.008和0.16 bits/dim,为最低值之一,表明AR模型无法检测到此类明显异常。
  • CCG方法正确将92.3%的CIFAR-10测试图像分类为分布内,而AR-2SD和AR-One-sided区间分别错误地将92.5%和94.7%的SVHN图像分类为CIFAR-10分布内。
  • 即使在对生成器输出或预训练生成器应用高斯模糊后,ARCycle仍无法生成真实图像,表明优化问题根植于NLL目标本身。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。