[论文解读] Deficiency-Aware Masked Transformer for Video Inpainting
本文提出了一种缺陷感知掩码变换器(DMT),这是一种支持双模态的视频修复框架,利用预训练的图像修复模型(DMT$_{\text{img}}$)作为先验,以增强在缺陷情形下的幻觉生成——即在所有帧中均缺失被掩码内容的情形。通过整合标记选择、掩码激活以及感受野上下文模块,DMT 降低了计算成本,提升了特征学习能力,并在 DAVIS 和 YouTube-VOS 数据集上实现了最先进性能,分别实现了 0.81 dB 和 0.56 dB 的 PSNR 提升。
Recent video inpainting methods have made remarkable progress by utilizing explicit guidance, such as optical flow, to propagate cross-frame pixels. However, there are cases where cross-frame recurrence of the masked video is not available, resulting in a deficiency. In such situation, instead of borrowing pixels from other frames, the focus of the model shifts towards addressing the inverse problem. In this paper, we introduce a dual-modality-compatible inpainting framework called Deficiency-aware Masked Transformer (DMT), which offers three key advantages. Firstly, we pretrain a image inpainting model DMT_img serve as a prior for distilling the video model DMT_vid, thereby benefiting the hallucination of deficiency cases. Secondly, the self-attention module selectively incorporates spatiotemporal tokens to accelerate inference and remove noise signals. Thirdly, a simple yet effective Receptive Field Contextualizer is integrated into DMT, further improving performance. Extensive experiments conducted on YouTube-VOS and DAVIS datasets demonstrate that DMT_vid significantly outperforms previous solutions. The code and video demonstrations can be found at github.com/yeates/DMT.
研究动机与目标
- 解决在所有帧中均缺失被掩码内容、跨帧传播失效的视频修复缺陷情形挑战。
- 通过将预训练图像修复模型的知识迁移至视频生成,弥合图像与视频修复之间的领域差距。
- 通过选择性处理有效时空标记并利用启发式机制激活无效标记,提升推理效率与鲁棒性。
- 通过引入新型感受野上下文模块(RFC)扩展感受野,以增强特征表示能力,捕捉高频信号。
- 通过适配文本或笔画输入,实现无需逐帧掩码的一次性对象移除,提升实际应用场景的适用性。
提出的方法
- 预训练一个独立的图像修复模型(DMT$_{\text{img}}$),作为视频修复的先验,以在缺陷情形下实现更优的幻觉生成。
- 从零开始训练视频模型(DMT$_{\text{vid}}$),采用持续学习损失,将 DMT$_{\text{img}}$ 的知识迁移至视频生成,同时平衡可塑性与稳定性。
- 引入标记选择机制,丢弃所有内部像素均被掩码的时空标记,从而降低噪声与计算成本。
- 提出掩码激活算法,在自注意力与卷积运算过程中迭代激活无效标记,以改善特征学习。
- 集成感受野上下文模块(RFC),采用大卷积核大小(K=13),以扩展感受野并捕捉高频细节。
- 应用迁移正则化(公式 5),在无需访问图像数据集的情况下,将图像模型的生成先验迁移至视频模型。
实验结果
研究问题
- RQ1预训练的图像修复模型能否有效作为先验,以提升缺陷情形下的视频修复性能?
- RQ2如何有效弥合图像与视频修复之间的领域差距,实现知识的高效迁移?
- RQ3哪些机制可在保持性能的前提下,降低视频修复变换器的计算复杂度与噪声?
- RQ4扩展感受野在多大程度上能改善特征表示与修复质量?
- RQ5所提出的框架能否在无需逐帧掩码监督的情况下,泛化至一次性对象移除任务?
主要发现
- DMT$_{\text{vid}}$ 在 DAVIS 数据集上相比之前最先进方法实现了 0.81 dB 的 PSNR 提升,在 YouTube-VOS 上实现了 0.56 dB 的提升,证明了其最先进性能。
- 采用 K=13 的感受野上下文模块(RFC)表现最佳,相比无 RFC 的基线模型提升 0.48 dB PSNR,相比基于 FFC 的替代方案提升 0.14 dB。
- 若省略掩码激活机制,PSNR 将下降 1.84 dB,凸显其在重建无效标记中的关键作用。
- 标记选择机制通过过滤完全被掩码的标记,降低了计算成本并提升了推理效率,其移除仅导致 0.08 dB 的 PSNR 下降。
- 迁移正则化使图像到视频修复的知识迁移成为可能,当其被排除时,PSNR 下降 0.31 dB。
- 该模型在真实世界场景中泛化良好,包括训练分布外的动画视频,且可通过文本或笔画输入实现一次性对象移除。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。