[论文解读] Divide-and-Conquer Adversarial Learning for High-Resolution Image and Video Enhancement
本文提出了一种弱监督深度学习框架——分治对抗学习(DACAL),用于高分辨率图像与视频增强。该框架通过分层分解将增强任务划分为感知、频率和维度三个子问题。通过整合多尺度与循环训练,DACAL在感知质量、色彩保真度、纹理清晰度和时间一致性方面均达到最先进性能,在图像与视频基准测试中优于WESPE与DPE等方法。
This paper introduces a divide-and-conquer inspired adversarial learning (DACAL) approach for photo enhancement. The key idea is to decompose the photo enhancement process into hierarchically multiple sub-problems, which can be better conquered from bottom to up. On the top level, we propose a perception-based division to learn additive and multiplicative components, required to translate a low-quality image or video into its high-quality counterpart. On the intermediate level, we use a frequency-based division with generative adversarial network (GAN) to weakly supervise the photo enhancement process. On the lower level, we design a dimension-based division that enables the GAN model to better approximates the distribution distance on multiple independent one-dimensional data to train the GAN model. While considering all three hierarchies, we develop multiscale and recurrent training approaches to optimize the image and video enhancement process in a weakly-supervised manner. Both quantitative and qualitative results clearly demonstrate that the proposed DACAL achieves the state-of-the-art performance for high-resolution image and video enhancement.
研究动机与目标
- 解决在缺乏像素级配对数据的情况下,对混合感知质量(如光照不良、对比度低、噪声多)的高分辨率图像与视频进行增强的挑战。
- 克服全监督方法对昂贵且对齐的低质量与高质量图像对的依赖。
- 改进弱监督GAN方法在高分辨率设置下多组件增强与空间/时间不一致性方面的局限性。
- 开发一种可扩展、稳定且感知鲁棒的增强框架,确保图像与视频中空间与时间的一致性。
提出的方法
- 提出一种分层分治策略,将增强任务分解为三个子问题:基于感知的(加法与乘法分量)、基于频率的(通过GAN实现弱监督)以及基于维度的(通过一维分布近似提升GAN训练)。
- 引入多尺度训练策略以保留高分辨率细节,避免因下采样或分块处理导致的空间不一致性。
- 采用DACAL的循环扩展,通过帧级特征传播在视频增强中实现时间一致性。
- 使用弱监督GAN目标,其中判别器学习高质量图像的分布,而生成器被引导将低质量输入映射为感知上逼真的输出。
- 应用基于感知的分解,将光照、色彩与纹理调整建模为相互关联但独立的组件。
- 利用基于维度的分解,通过近似独立的一维数据流之间的分布距离,提升GAN训练的稳定性。
实验结果
研究问题
- RQ1将图像增强任务分层分解为基于感知、频率与维度的子问题,是否能提升弱监督GAN增强模型的性能?
- RQ2多尺度与循环训练策略在高分辨率图像与视频增强中,如何提升空间与时间一致性?
- RQ3所提出的DACAL框架在感知质量与伪影减少方面,相较于现有弱监督方法(如WESPE与DPE)的优越程度如何?
- RQ4分治范式能否有效应用于对抗学习,以稳定高分辨率增强任务中的训练过程并提升分布近似能力?
主要发现
- 在DPED数据集上,DACAL采用完整的分层分解(l+f+d)时,PSNR达到20.90,SSIM达到0.874,显著优于WESPE(17.45 PSNR)与DPE(18.53 PSNR)。
- 在HuaweiM20Pro-Flickr数据集上,用户研究显示,DACAL在偏好比例上达到366:34,优于WESPE(341:59)与DPE(360:40),表明其在人类感知上更具优势。
- 在视频增强中,DACAL的循环变体相比DPE等逐帧方法,显著减少了时间伪影与运动物体不一致性,尤其在使用高质量参考图像微调后表现更优。
- 定性结果表明,DACAL在色彩还原、纹理清晰度与光照调整方面表现更优,尤其在低光与过曝区域。
- 该方法有效避免了WESPE常见的过曝问题,也克服了DPE的纹理退化缺陷,展现出在多样化图像条件下的鲁棒性。
- 用户研究表明,在DPED数据集上,DACAL在400次投票中有395次优于Adobe专业修图工具,表明其具有显著的感知优越性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。