[论文解读] Time Lens++: Event-based Frame Interpolation with Parametric Non-linear Flow and Multi-scale Fusion
Time Lens++ 提出了一种新颖的基于事件的视频帧插值方法,通过参数化非线性运动估计与多尺度特征级融合,提升了重建质量与时间一致性。通过从事件和图像中估计连续且可重用的光流,该方法降低了计算成本,并缓解了图像级融合与事件稀疏性带来的伪影,相较于先前方法,PSNR 最高提升 0.2 dB,LPIPS 改善 15%。
Recently, video frame interpolation using a combination of frame- and event-based cameras has surpassed traditional image-based methods both in terms of performance and memory efficiency. However, current methods still suffer from (i) brittle image-level fusion of complementary interpolation results, that fails in the presence of artifacts in the fused image, (ii) potentially temporally inconsistent and inefficient motion estimation procedures, that run for every inserted frame and (iii) low contrast regions that do not trigger events, and thus cause events-only motion estimation to generate artifacts. Moreover, previous methods were only tested on datasets consisting of planar and faraway scenes, which do not capture the full complexity of the real world. In this work, we address the above problems by introducing multi-scale feature-level fusion and computing one-shot non-linear inter-frame motion from events and images, which can be efficiently sampled for image warping. We also collect the first large-scale events and frames dataset consisting of more than 100 challenging scenes with depth variations, captured with a new experimental setup based on a beamsplitter. We show that our method improves the reconstruction quality by up to 0.2 dB in terms of PSNR and up to 15% in LPIPS score.
研究动机与目标
- 解决基于事件的帧插值中图像级融合的脆弱性,该问题会将基于合成的结果中的伪影传播开来。
- 克服现有方法中独立处理每一帧所导致的时间不一致且低效的运动估计问题。
- 缓解在低对比度区域中事件稀疏或缺失时的运动估计失败问题。
- 开发一种利用图像与事件数据实现时间一致、单次前向传播的非线性光流估计器,以实现高效的多帧插值。
- 构建一个大规模、多样化的数据集,包含深度变化与复杂动态,以更好地评估真实世界性能。
提出的方法
- 提出一种参数化非线性运动样条估计器,能够从事件和图像中预测连续光流场,实现对 N 个中间帧的 O(1) 计算,而非 O(N)。
- 在运动模块中采用双编码器架构——分别为事件和图像设置独立编码器,以实现特征的独立学习并提升鲁棒性。
- 实现一种具有共享合成编码器与门控压缩机制的多尺度特征融合模块,以在每个尺度上选择信息量丰富的特征。
- 采用多阶段训练策略,通过先分别训练编码器再进行联合优化,防止网络忽略某一模态(如图像)。
- 利用新型基于分束器的设置实现 RGB 相机与事件相机的同步,实现多模态数据的精确时间对齐与物理标定。
- 通过事件融合与图像差分互相关方法,校正近距离场景中的残余像素错位。

实验结果
研究问题
- RQ1能否通过基于事件与图像的一次性、连续非线性光流估计器,提升帧插值的时间一致性并降低计算成本?
- RQ2多尺度特征级融合是否优于图像级融合,从而更有效地减少基于合成插值产生的鬼影与伪影传播?
- RQ3在事件活动极少的低对比度区域中,引入图像数据在多大程度上改善了运动估计?
- RQ4多阶段训练在多大程度上防止了模态崩溃,并提升了互补事件与图像信号的融合效果?
- RQ5在包含深度变化与复杂动态的多样化、大规模数据集上,该方法在非平面场景之外的真实世界场景中表现如何?
主要发现
- 与基准数据集和新数据集上的最先进方法相比,所提方法在 PSNR 上最高提升 0.2 dB,LPIPS 最多降低 15%。
- 多阶段训练策略使运动估计模块的 PSNR 提升 0.69 dB,融合模块提升 1.06 dB,证明其在防止模态忽略方面的有效性。
- 结合门控压缩的多尺度融合模块相比共享合成编码器提升 0.13 dB PSNR,结合多阶段训练则实现 1.06 dB 的提升。
- 注意力图显示,融合网络在粗尺度上优先使用合成特征,在细尺度上则更依赖变形特征,与预期的互补优势一致。
- 新构建的 123 个场景数据集包含深度变化、液体、火焰与运动背景,揭示了在复杂真实场景中的显著性能提升。
- 运动样条估计器实现了高效且时间一致的光流采样,将 N 个插入帧的计算成本从 O(N) 降低至 O(1)。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。