[论文解读] A Loss Function for Generative Neural Networks Based on Watson's Perceptual Model
本文提出了一种基于沃森视觉感知模型的可微分、感知驱动的损失函数,用于生成神经网络,通过引入离散傅里叶变换(DFT)、色彩支持、随机拼接(tiling)以及可微分操作进行增强。该损失函数基于人类相似性判断数据进行训练,在图像质量和效率方面优于L2、SSIM和深度度量损失,显著减少了变分自编码器(VAE)生成图像中的模糊和伪影。
To train Variational Autoencoders (VAEs) to generate realistic imagery requires a loss function that reflects human perception of image similarity. We propose such a loss function based on Watson's perceptual model, which computes a weighted distance in frequency space and accounts for luminance and contrast masking. We extend the model to color images, increase its robustness to translation by using the Fourier Transform, remove artifacts due to splitting the image into blocks, and make it differentiable. In experiments, VAEs trained with the new loss function generated realistic, high-quality image samples. Compared to using the Euclidean distance and the Structural Similarity Index, the images were less blurry; compared to deep neural network based losses, the new approach required less computational resources and generated images with less artifacts.
研究动机与目标
- 为解决使用标准像素级损失(如L2或SSIM)训练时,VAE生成图像感知质量差、常出现模糊的问题。
- 克服基于深度神经网络的感知损失的局限性,后者可能因预训练于分类任务而对视觉伪影不敏感。
- 开发一种轻量化、可微分且鲁棒的感知损失函数,其基础为人眼视觉感知,具体基于沃森模型。
- 在最小化计算成本与生成样本中伪影的同时,提升模型在不同图像领域(如数字、人脸)的泛化能力。
提出的方法
- 将沃森模型中原有的离散余弦变换(DCT)替换为离散傅里叶变换(DFT),通过分离幅度与相位信息,提升对微小平移变化的鲁棒性。
- 将原始单色沃森模型扩展为支持彩色图像,通过独立处理各通道并整合感知权重实现。
- 将块状DFT计算中的固定网格替换为随机化网格,以消除网格引起的伪影。
- 将原始模型中不可微的max操作替换为可微分近似,以支持VAE的端到端训练。
- 利用人类相似性判断数据优化感知损失函数,通过训练自由参数使其与人类感知对齐。
- 将所得可微分感知损失集成至VAE训练中,替代标准的L2或SSIM损失。
实验结果
研究问题
- RQ1与标准L2或SSIM损失相比,基于感知基础且显式建模的沃森模型是否能提升VAE的图像生成质量?
- RQ2用DFT替代DCT是否能增强感知损失函数对小图像位移的鲁棒性?
- RQ3非神经网络的可微分感知损失是否能在图像质量与计算效率方面超越基于深度神经网络的损失?
- RQ4在块处理中使用随机拼接是否能消除损失计算中的可见网格伪影?
- RQ5该改进后的沃森基损失在包括数字与名人面部图像在内的多样化图像领域中,泛化能力如何?
主要发现
- 经人类评估与视觉检查确认,使用所提感知损失训练的VAE生成的图像显著比使用L2或SSIM损失训练的图像更少模糊。
- 尽管计算与内存资源消耗显著更低,该新损失函数生成的图像伪影也少于当前最先进的基于深度度量的损失(如LPIPS)。
- 该模型在不同图像领域(如手写数字与名人面部图像)中均表现出良好泛化能力,无需领域特定微调。
- 通过将max操作替换为可微分版本,损失函数实现可微分化,支持VAE的稳定端到端训练,且性能无下降。
- 基于DFT的方法提升了对小位移的鲁棒性,表现为在微小平移下感知相似度得分保持一致,而原始DCT模型则表现不稳定。
- 在人类相似性数据上进行训练的感知损失,其拟合人类判断的效果优于L2与SSIM,且在图像生成质量方面超越了深度度量基线。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。