[论文解读] Learning Joint Spatial-Temporal Transformations for Video Inpainting
本文提出STTN,一种用于视频修复的联合时空变换器网络,通过多尺度块状自注意力机制,同时在所有输入帧中完成缺失区域的修复。通过优化时空对抗损失,STTN实现了最先进性能,在具有挑战性的掩码下,PSNR相比先前方法提升2.4%,VFID提升19.7%。
High-quality video inpainting that completes missing regions in video frames is a promising yet challenging task. State-of-the-art approaches adopt attention models to complete a frame by searching missing contents from reference frames, and further complete whole videos frame by frame. However, these approaches can suffer from inconsistent attention results along spatial and temporal dimensions, which often leads to blurriness and temporal artifacts in videos. In this paper, we propose to learn a joint Spatial-Temporal Transformer Network (STTN) for video inpainting. Specifically, we simultaneously fill missing regions in all input frames by self-attention, and propose to optimize STTN by a spatial-temporal adversarial loss. To show the superiority of the proposed model, we conduct both quantitative and qualitative evaluations by using standard stationary masks and more realistic moving object masks. Demo videos are available at https://github.com/researchmm/STTN.
研究动机与目标
- 通过联合建模空间与时间依赖关系,解决逐帧视频修复中的时间不一致性和模糊问题。
- 克服逐帧或分步注意力机制在复杂运动与外观变化下失效的局限性。
- 通过统一的变换器架构,实现所有输入帧的同时修复,从而提升视频修复质量。
- 通过新颖的时空对抗损失,增强感知质量与时间一致性。
- 通过变换器中的多尺度非重叠块表示,实现快速训练与推理。
提出的方法
- 提出一种多尺度块状注意力模块,从所有帧中提取不同尺寸的非重叠块,以捕捉多样的运动模式。
- 采用多头变换器,在不同尺度的空间块之间计算相似性,并聚合注意力结果以实现一致的内容生成。
- 堆叠多个时空变换器层,通过更新的上下文迭代优化缺失区域特征。
- 引入一种时空对抗损失,联合优化帧间感知质量与时间一致性。
- 将视频修复视为“多对多”任务,所有输入帧同时处理,而非顺序处理。
- 使用采用STTN架构的生成器网络生成修复后的帧,通过对抗损失端到端训练。
实验结果
研究问题
- RQ1与逐帧方法相比,联合时空变换器架构是否能提升时间一致性并减少模糊?
- RQ2多尺度块状注意力在建模帧间复杂运动与外观变化方面是否有效?
- RQ3堆叠多个变换器层是否能在视频修复中带来持续的性能提升?
- RQ4时空对抗损失是否能增强生成视频的感知质量并减少时间伪影?
- RQ5在真实自由形状掩码(如移动物体或大范围遮挡)下,该方法表现如何?
主要发现
- 在DAVIS和YouTube-VOS数据集上,STTN在自由形状掩码下相比最先进方法,PSNR相对提升2.4%,VFID相对提升19.7%。
- 消融实验表明,多尺度块表示显著提升性能,最佳结果在组合108×60、36×20、18×10和9×5块尺寸时取得。
- 堆叠八个变换器层达到最佳性能,且随着堆叠深度增加性能持续提升,表明迭代优化具有优势。
- 用户研究显示,在80%的试验中,STTN在静态与移动掩码下均被评为最佳性能模型,证实其优越的感知质量。
- 尽管结果优异,STTN在大掩码下仍难以捕捉快速连续运动(如舞蹈),因缺乏3D时间建模,仅依赖2D块注意力导致模糊。
- 由于采用高效且非重叠的多尺度块表示,模型展现出快速训练与推理能力,适用于实时视频理解任务。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。