[论文解读] Probabilistic Semantic Inpainting with Pixel Constrained CNNs
本文提出Pixel Constrained CNNs,一种基于改进PixelCNN的基于概率的语义修复方法,通过建模在可见像素条件下的图像分布,实现多样且逼真的图像补全,并可进行似然估计。在MNIST和CelebA上的实验表明,该方法在MNIST上表现出高样本多样性与强人类感知相关性,但在CelebA上对复杂人脸的似然估计可靠性较低。
Semantic inpainting is the task of inferring missing pixels in an image given surrounding pixels and high level image semantics. Most semantic inpainting algorithms are deterministic: given an image with missing regions, a single inpainted image is generated. However, there are often several plausible inpaintings for a given missing region. In this paper, we propose a method to perform probabilistic semantic inpainting by building a model, based on PixelCNNs, that learns a distribution of images conditioned on a subset of visible pixels. Experiments on the MNIST and CelebA datasets show that our method produces diverse and realistic inpaintings.
研究动机与目标
- 通过生成多个合理的补全结果而非单一的确定性输出,来解决图像修复中的固有不确定性。
- 开发一种模型,学习在给定可见像素条件下的图像条件分布,从而可从逼真补全结果的分布中采样。
- 估计生成补全结果的似然,从而实现按合理性对样本进行排序。
- 与基于GAN或优化的确定性方法相比,提升样本多样性。
- 评估模型估计的似然是否与人类对图像合理性的感知相关。
提出的方法
- 将PixelCNN扩展为可基于任意可见像素集合进行条件建模,而不仅限于上方和左侧的像素,从而支持不规则或非矩形掩码的修复。
- 使用自回归建模方法,基于先前生成的像素和可见像素约束,预测每个像素的分布。
- 引入一种条件输入机制,编码可见像素并将它们整合进自回归生成过程。
- 采用改进的损失函数,结合像素级交叉熵与正则化项,以保持与可见像素的一致性。
- 利用自回归结构计算生成图像的精确似然,从而实现模型评估与样本排序。
- 采用多尺度架构以提升建模能力,捕捉图像的局部与全局结构。
实验结果
研究问题
- RQ1概率模型能否在可见像素条件下,即使对于不规则或非矩形掩码,也生成多样且逼真的图像补全?
- RQ2模型估计的似然是否与人类对图像合理性的感知相关?
- RQ3与最先进确定性修复方法相比,该模型在多样性与真实感方面的表现如何?
- RQ4为何在CelebA等复杂数据集上,似然估计无法与人类感知相关联?
- RQ5模型能否通过自回归生成过程有效传播不确定性,如通过演化像素概率图所示?
主要发现
- 该模型在MNIST和CelebA上均能生成多样且逼真的补全结果,通过视觉与定量分析确认了高样本多样性。
- 在MNIST上,49.7%的用户响应与模型的似然排序一致,表明其与人类对合理性的感知具有强相关性。
- 在CelebA上,56.6%的用户不同意模型的似然估计,表明该模型对复杂面部数据的似然估计可靠性较低。
- 模型的像素概率图在生成过程中随时间演化,随着更多像素被采样,置信度逐渐提高,并正确偏向于合理的补全结果。
- 失败案例显示,模型可能生成不合理的补全或在掩码边界附近出现像素错配,表明其对掩码结构和模型收敛性较为敏感。
- 由于自回归生成机制,模型的似然估计计算成本较高,需要与图像像素数相当的前向传播次数。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。