[论文解读] Hybrid Neural Fusion for Full-frame Video Stabilization
本文提出了一种基于学习的混合神经融合方法,用于全帧视频稳定,通过融合多个相邻帧的形变特征来合成稳定帧。通过结合特征级和图像级融合,并采用可学习的混合权重与残差细节传递,该方法减少了因光流不准确导致的伪影,并避免了激进的裁剪,实现了在NUS、Selfie和DeepStab数据集上的全视场稳定,且视觉质量更优。
Existing video stabilization methods often generate visible distortion or require aggressive cropping of frame boundaries, resulting in smaller field of views. In this work, we present a frame synthesis algorithm to achieve full-frame video stabilization. We first estimate dense warp fields from neighboring frames and then synthesize the stabilized frame by fusing the warped contents. Our core technical novelty lies in the learning-based hybrid-space fusion that alleviates artifacts caused by optical flow inaccuracy and fast-moving objects. We validate the effectiveness of our method on the NUS, selfie, and DeepStab video datasets. Extensive experiment results demonstrate the merits of our approach over prior video stabilization methods.
研究动机与目标
- 解决现有视频稳定方法因帧边界缺失像素而需激进裁剪的局限性。
- 克服因光流不准确和快速运动物体在稳定帧中产生的伪影。
- 通过融合多个相邻帧实现在无分辨率损失情况下的全视场稳定。
- 通过可学习的混合权重和高频细节传递提升视觉质量。
- 在保持或扩展原始视场的同时,确保时间稳定性并减少失真。
提出的方法
- 使用光流或运动估计网络从相邻帧中估计密集形变场。
- 将输入帧编码为丰富的CNN特征表示,以实现鲁棒融合。
- 实现一种混合融合机制,结合特征级和图像级融合,以降低对光流误差的敏感性。
- 学习空间可变的混合权重,以动态组合形变特征并最小化伪影。
- 通过带有残差细节传递的神经解码器网络重建最终稳定帧,以获得更锐利的输出。
- 应用路径调整以平衡运动平滑与帧覆盖,最小化无有效输入的区域。
![Figure 2: Limitations of current state-of-the-art video stabilization techniques. (a) Current commercial video stabilization software (Adobe Premiere Pro 2020) fails to generate smooth videos in challenging scenarios of rapid camera shakes. (b) Yu and Ramamoorthi’s method [ 70 ] produces a temporall](https://ar5iv.labs.arxiv.org/html/2102.06205/assets/figures/intro/QuickRotation_6_00230_Adobe.jpg)
实验结果
研究问题
- RQ1基于学习的融合策略是否能有效减少视频稳定中因光流不准确引起的伪影?
- RQ2如何组合多个形变帧以实现在无激进裁剪情况下的全帧稳定?
- RQ3与单层次融合相比,混合特征级和图像级融合在多大程度上提升了视觉质量?
- RQ4所提方法是否能在保持或扩展原始视场的同时确保时间稳定性?
- RQ5学习到的混合权重与残差细节传递的集成如何提升稳定帧的清晰度与真实感?
主要发现
- 所提方法在NUS和Selfie数据集上实现了100%的裁剪率,表明无帧边界裁剪,实现了全视场稳定。
- 在Selfie数据集上,当与Yu和Ramamoorthi的光流平滑方法结合时,该方法将C(内容)、D(失真)、S(稳定性)和A(伪影)得分分别提升至1.00、0.87、0.87和0.64。
- 在Tanks and Temples数据集的Trucks序列上,该方法在LPIPS(0.12)、SSIM(0.882)和PSNR(23.25)指标上表现最佳,优于FVS和其他SOTA图像合成方法。
- 视觉对比显示,与DIFRINT和Adobe Premiere Pro相比,所提方法在高动态和遮挡易发场景中产生更少伪影且结果更锐利。
- 消融实验证实,混合融合、可学习混合权重和残差细节传递各自在减少模糊和失真方面具有显著贡献。
- 该方法在多种数据集上均保持强劲性能,包括NUS(具有挑战性的手持视频)、Selfie(大运动自拍视频)和DeepStab(高动态稳定任务)。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。