[论文解读] Adversarial Video Compression Guided by Soft Edge Detection
该论文提出了一种基于生成对抗网络(GAN)的视频压缩框架,利用软边缘检测器从关键帧生成低层次特征图,从而在极低比特率下实现高质量重建。通过在少量关键帧及其对应的软边缘图上训练条件GAN,该方法在10 Kbps以下的比特率下,相较于H.264和HEVC,实现了更优的主观视觉质量,尤其在标准编解码器失效的极低比特率区域表现突出。
We propose a video compression framework using conditional Generative Adversarial Networks (GANs). We rely on two encoders: one that deploys a standard video codec and another which generates low-level maps via a pipeline of down-sampling, a newly devised soft edge detector, and a novel lossless compression scheme. For decoding, we use a standard video decoder as well as a neural network based one, which is trained using a conditional GAN. Recent "deep" approaches to video compression require multiple videos to pre-train generative networks to conduct interpolation. In contrast to this prior work, our scheme trains a generative decoder on pairs of a very limited number of key frames taken from a single video and corresponding low-level maps. The trained decoder produces reconstructed frames relying on a guidance of low-level maps, without any interpolation. Experiments on a diverse set of 131 videos demonstrate that our proposed GAN-based compression engine achieves much higher quality reconstructions at very low bitrates than prevailing standard codecs such as H.264 or HEVC.
研究动机与目标
- 为解决标准视频编解码器(如H.264和HEVC)在极低比特率下视觉质量显著下降的局限性。
- 减少在视频压缩中预训练生成模型对大规模视频数据集的依赖。
- 通过条件GAN架构利用语义边缘信息,提升极低比特率下的重建质量。
- 探究软边缘图是否可作为神经视频解码的有效引导,而无需插值。
- 评估客观视频质量评估(VQA)指标与主观视觉质量之间在GAN压缩视频中的性能差距。
提出的方法
- 该框架使用两个编码器:一个用于关键帧的标准H.264压缩,另一个则应用下采样流程并结合一种新型软边缘检测器,生成低分辨率边缘图。
- 软边缘检测器被设计为生成可微分的、连续的边缘表示,从而支持反向传播的端到端训练。
- 基于条件GAN的解码器在关键帧及其对应软边缘图对上进行训练,利用判别器强制实现感知真实的图像生成。
- 解码器从软边缘图和关键帧信息中重建全分辨率帧,无需帧间插值。
- 采用一种新型无损压缩方案对软边缘图进行压缩,以进一步降低比特率。
- 系统仅使用单个视频的1%帧作为关键帧进行训练,避免了对大规模视频数据集的需求。
实验结果
研究问题
- RQ1软边缘图是否可作为极低比特率下神经视频解码的有效且高效引导?
- RQ2在单个视频中仅使用少量关键帧进行训练的GAN解码器,是否在极低比特率下优于H.264和HEVC等标准编解码器?
- RQ3为何客观VQA指标(如PSNR、SSIM)在比特率高于10 Kbps时,常将GAN压缩视频的排名低于H.264,尽管其主观视觉质量更优?
- RQ4与依赖插值的典型深度神经网络(DNN)视频压缩方法相比,基于边缘的引导在多大程度上提升了重建保真度?
- RQ5即使使用轻量级、非优化的网络结构,是否仍能在极低比特率下实现更优的主观视觉质量,从而表明通过更深层架构仍有优化空间?
主要发现
- 在比特率低于10 Kbps时,我们的GAN编解码器在主观视觉质量上显著优于H.264和HEVC,且在7.14 Kbps时仍能实现可接受的重建质量,而H.264已完全失效。
- 在比特率低于7.5 Kbps时,我们的模型生成了可识别且细节丰富的图像帧,而H.264则产生无法辨认的块状伪影。
- 在KTH和YouTube姿态数据集上,我们的模型在131段视频中,于MS-SSIM、PSNR、SSIM和VMAF指标上均优于H.264,尤其在3–30 Kbps范围内表现更优。
- 尽管主观视觉质量更优,但在比特率高于10 Kbps时,我们的模型客观VQA指标(如PSNR、SSIM)常低于H.264,表明客观指标与人类感知之间存在不匹配。
- 在6.51 Kbps时,我们的模型视觉质量已超越H.264在11.00 Kbps时的表现,尽管客观指标排名H.264更高,这表明当前VQA模型在评估GAN生成内容时存在局限性。
- 该框架表明,基于边缘的引导可实现高质量重建,且仅需极少量训练数据,即仅使用单个视频中1%的帧作为关键帧。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。