Skip to main content
QUICK REVIEW

[论文解读] Deficiency-Aware Masked Transformer for Video Inpainting

Yongsheng Yu, Heng Fan|arXiv (Cornell University)|Jul 17, 2023
Generative Adversarial Networks and Image Synthesis被引用 5
一句话总结

本文提出了一种缺陷感知掩码变换器(DMT),这是一种支持双模态的视频修复框架,利用预训练的图像修复模型(DMT$_{\text{img}}$)作为先验,以增强在缺陷情形下的幻觉生成——即在所有帧中均缺失被掩码内容的情形。通过整合标记选择、掩码激活以及感受野上下文模块,DMT 降低了计算成本,提升了特征学习能力,并在 DAVIS 和 YouTube-VOS 数据集上实现了最先进性能,分别实现了 0.81 dB 和 0.56 dB 的 PSNR 提升。

ABSTRACT

Recent video inpainting methods have made remarkable progress by utilizing explicit guidance, such as optical flow, to propagate cross-frame pixels. However, there are cases where cross-frame recurrence of the masked video is not available, resulting in a deficiency. In such situation, instead of borrowing pixels from other frames, the focus of the model shifts towards addressing the inverse problem. In this paper, we introduce a dual-modality-compatible inpainting framework called Deficiency-aware Masked Transformer (DMT), which offers three key advantages. Firstly, we pretrain a image inpainting model DMT_img serve as a prior for distilling the video model DMT_vid, thereby benefiting the hallucination of deficiency cases. Secondly, the self-attention module selectively incorporates spatiotemporal tokens to accelerate inference and remove noise signals. Thirdly, a simple yet effective Receptive Field Contextualizer is integrated into DMT, further improving performance. Extensive experiments conducted on YouTube-VOS and DAVIS datasets demonstrate that DMT_vid significantly outperforms previous solutions. The code and video demonstrations can be found at github.com/yeates/DMT.

研究动机与目标

  • 解决在所有帧中均缺失被掩码内容、跨帧传播失效的视频修复缺陷情形挑战。
  • 通过将预训练图像修复模型的知识迁移至视频生成,弥合图像与视频修复之间的领域差距。
  • 通过选择性处理有效时空标记并利用启发式机制激活无效标记,提升推理效率与鲁棒性。
  • 通过引入新型感受野上下文模块(RFC)扩展感受野,以增强特征表示能力,捕捉高频信号。
  • 通过适配文本或笔画输入,实现无需逐帧掩码的一次性对象移除,提升实际应用场景的适用性。

提出的方法

  • 预训练一个独立的图像修复模型(DMT$_{\text{img}}$),作为视频修复的先验,以在缺陷情形下实现更优的幻觉生成。
  • 从零开始训练视频模型(DMT$_{\text{vid}}$),采用持续学习损失,将 DMT$_{\text{img}}$ 的知识迁移至视频生成,同时平衡可塑性与稳定性。
  • 引入标记选择机制,丢弃所有内部像素均被掩码的时空标记,从而降低噪声与计算成本。
  • 提出掩码激活算法,在自注意力与卷积运算过程中迭代激活无效标记,以改善特征学习。
  • 集成感受野上下文模块(RFC),采用大卷积核大小(K=13),以扩展感受野并捕捉高频细节。
  • 应用迁移正则化(公式 5),在无需访问图像数据集的情况下,将图像模型的生成先验迁移至视频模型。

实验结果

研究问题

  • RQ1预训练的图像修复模型能否有效作为先验,以提升缺陷情形下的视频修复性能?
  • RQ2如何有效弥合图像与视频修复之间的领域差距,实现知识的高效迁移?
  • RQ3哪些机制可在保持性能的前提下,降低视频修复变换器的计算复杂度与噪声?
  • RQ4扩展感受野在多大程度上能改善特征表示与修复质量?
  • RQ5所提出的框架能否在无需逐帧掩码监督的情况下,泛化至一次性对象移除任务?

主要发现

  • DMT$_{\text{vid}}$ 在 DAVIS 数据集上相比之前最先进方法实现了 0.81 dB 的 PSNR 提升,在 YouTube-VOS 上实现了 0.56 dB 的提升,证明了其最先进性能。
  • 采用 K=13 的感受野上下文模块(RFC)表现最佳,相比无 RFC 的基线模型提升 0.48 dB PSNR,相比基于 FFC 的替代方案提升 0.14 dB。
  • 若省略掩码激活机制,PSNR 将下降 1.84 dB,凸显其在重建无效标记中的关键作用。
  • 标记选择机制通过过滤完全被掩码的标记,降低了计算成本并提升了推理效率,其移除仅导致 0.08 dB 的 PSNR 下降。
  • 迁移正则化使图像到视频修复的知识迁移成为可能,当其被排除时,PSNR 下降 0.31 dB。
  • 该模型在真实世界场景中泛化良好,包括训练分布外的动画视频,且可通过文本或笔画输入实现一次性对象移除。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。