[论文解读] Deep Exemplar-based Video Colorization
该论文提出了首个用于示例驱动视频着色的端到端深度学习框架,通过循环网络统一了语义对应与颜色传播。通过联合训练对应子网络与着色子网络,并引入时间一致性损失,该方法在定量指标和用户评测中均优于当前最先进方法,实现了更优的时间稳定性与真实感。
This paper presents the first end-to-end network for exemplar-based video colorization. The main challenge is to achieve temporal consistency while remaining faithful to the reference style. To address this issue, we introduce a recurrent framework that unifies the semantic correspondence and color propagation steps. Both steps allow a provided reference image to guide the colorization of every frame, thus reducing accumulated propagation errors. Video frames are colorized in sequence based on the colorization history, and its coherency is further enforced by the temporal consistency loss. All of these components, learned end-to-end, help produce realistic videos with good temporal stability. Experiments show our result is superior to the state-of-the-art methods both quantitatively and qualitatively.
研究动机与目标
- 解决视频着色中的时间不一致性问题,同时保持对参考风格的忠实度。
- 通过利用参考图像引导每一帧,克服逐帧着色中的误差累积问题。
- 将语义对应与颜色传播统一到单一循环架构中,实现联合优化。
- 支持使用来自不同场景的参考图像实现鲁棒着色,支持可定制的多模态结果。
- 通过端到端训练与新颖损失函数的结合,实现实时推理速度,同时保持高质量着色效果。
提出的方法
- 采用循环神经网络按顺序处理视频帧,将前一帧的着色输出作为上下文信息。
- 引入一个对应子网络,学习参考图像与每一帧输入之间的密集语义对应关系。
- 利用对齐后的参考图像与前一帧的着色结果作为双重引导,输入至着色子网络,以生成一致且逼真的颜色。
- 使用复合损失函数对整个网络进行端到端训练,损失函数包含L1损失、感知损失、基于FID的真实性损失以及时间一致性损失。
- 应用时间一致性损失,惩罚相邻帧之间的颜色差异,以减少闪烁现象。
- 通过允许参考图像来自与视频不同的场景,实现灵活的参考使用方式,支持多模态着色。
实验结果
研究问题
- RQ1深度学习模型是否能在循环视频着色框架中联合优化语义对应与着色?
- RQ2在不完全依赖逐帧传播的前提下,如何提升示例驱动视频着色中的时间一致性?
- RQ3来自不同场景的参考图像在多大程度上能够引导跨视频帧的逼真且一致的着色?
- RQ4与后处理或迭代对齐方法相比,采用多组件损失函数的端到端训练是否能在速度与质量上实现超越?
- RQ5在视觉真实感、时间稳定性与用户偏好方面,该方法与当前最先进方法相比表现如何?
主要发现
- 所提方法在所有对比方法中取得了最低的Fréchet Inception Distance (FID) 分数,表明其着色结果最具真实感。
- 在用户评测中,该方法在与逐帧自动着色方法的对比中,有50.66%的比较选择为首选,显著优于其他方法。
- 在传播任务中,该方法在长序列帧中保持了稳定的PSNR曲线,长期一致性优于基于光流的方法以及STN/VPN方法。
- 网络推理速度为每帧0.61秒,比使用迭代优化进行对齐的最先进方法[30]快两个数量级。
- 即使参考图像来自与视频不同的场景,该方法仍能生成鲜艳、无伪影且闪烁极少的结果。
- 时间一致性损失有效减少了帧间颜色变化,使视频序列更加平滑稳定。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。