Skip to main content
QUICK REVIEW

[论文解读] Deep Video Inpainting Detection

Peng Zhou, Ning Yu|arXiv (Cornell University)|Jan 26, 2021
Generative Adversarial Networks and Image Synthesis参考文献 44被引用 9
一句话总结

该论文提出VIDNet,一种新颖的端到端深度学习框架,通过结合RGB和错误等级分析(ELA)帧的多模态特征,辅以四向局部注意力模块和基于ConvLSTM的时序建模,实现对视频中修复区域的检测。VIDNet在域内和跨域视频修复检测任务中均达到最先进性能,展现出强大的泛化能力以及对压缩和噪声扰动的鲁棒性。

ABSTRACT

This paper studies video inpainting detection, which localizes an inpainted region in a video both spatially and temporally. In particular, we introduce VIDNet, Video Inpainting Detection Network, which contains a two-stream encoder-decoder architecture with attention module. To reveal artifacts encoded in compression, VIDNet additionally takes in Error Level Analysis frames to augment RGB frames, producing multimodal features at different levels with an encoder. Exploring spatial and temporal relationships, these features are further decoded by a Convolutional LSTM to predict masks of inpainted regions. In addition, when detecting whether a pixel is inpainted or not, we present a quad-directional local attention module that borrows information from its surrounding pixels from four directions. Extensive experiments are conducted to validate our approach. We demonstrate, among other things, that VIDNet not only outperforms by clear margins alternative inpainting detection methods but also generalizes well on novel videos that are unseen during training.

研究动机与目标

  • 为应对恶意视频修复检测的迫切需求,此类修复可能引发虚假信息传播和证据篡改。
  • 开发首个基于学习的视频修复检测框架,因以往研究主要聚焦于图像级篡改检测。
  • 通过利用RGB和ELA特征提供的多模态线索,揭示压缩伪影,提升检测鲁棒性。
  • 通过四向局部注意力模块和ConvLSTM解码器,显式建模空间与时序依赖关系,实现对修复区域的精确时空定位。

提出的方法

  • VIDNet采用双流编码器-解码器架构,同时处理RGB帧和ELA帧,以在多尺度上提取多模态特征。
  • 编码器使用预训练的VGG网络提取RGB帧的特征,而ELA帧则用于揭示压缩不一致性和伪影。
  • 在最终的RGB特征图上应用四向局部注意力(QDLA)模块,从四个方向关注邻近像素,增强空间上下文建模能力。
  • 将不同尺度的多模态特征进行融合,并输入到四层卷积长短期记忆网络(ConvLSTM)解码器中,以建模视频帧之间的时序动态。
  • 解码器通过来自较粗粒度层的跳跃连接,保留空间细节,提升掩码预测的准确性。
  • 整个网络通过反向传播进行端到端训练,采用二元交叉熵损失函数进行像素级修复掩码预测。

实验结果

研究问题

  • RQ1通过结合RGB和ELA特征,深度学习框架能否有效检测视频中的修复区域?
  • RQ2与标准注意力机制或全局池化相比,通过四向注意力建模空间上下文是否能显著提升检测性能?
  • RQ3该视频修复检测模型在未见过的修复方法和测试数据集上,其泛化能力能达到何种程度?
  • RQ4在常见视频失真(如高斯噪声和JPEG压缩)下,所提方法的鲁棒性如何?
  • RQ5通过ConvLSTM引入时序建模是否能带来更时序一致且更准确的修复掩码预测?

主要发现

  • 在自由形式视频修复(FVI)数据集上,VIDNet的平均IoU达到0.257,F1得分为0.367,相比次优方法(GSR-Net)在F1得分上提升70%。
  • 在DAVIS 2016数据集上,VIDNet显著优于所有对比方法,展现出更高的检测准确率和更强的鲁棒性。
  • 该模型对域外修复视频具有良好的泛化能力,即使在训练数据中未出现的修复方法生成的视频上,仍保持强劲性能。
  • 训练阶段加入噪声和JPEG增强可提升对扰动的鲁棒性,VIDNet在SNR 20 dB和JPEG质量70下仍保持高性能。
  • 消融实验表明,结合RGB与ELA特征、QDLA模块及ConvLSTM可获得最高性能,验证了各组件的贡献。
  • 定性结果表明,与GSR-Net等逐帧方法相比,VIDNet生成的掩码更具时序一致性与空间准确性,后者存在闪烁和不一致问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。