[论文解读] Robust Watermarking for Video Forgery Detection with Improved Imperceptibility and Robustness
本文提出RWVFD,一种基于3D-UNet的端到端视频水印框架,可联合嵌入不可察觉的水印并实现鲁棒的篡改区域定位。通过集成多种失真(如JPEG、模糊化)模拟视频压缩和后期处理攻击,该方法在保持高不可察觉性(PSNR: 37.78 dB,SSIM: 0.987)的同时展现出强大的鲁棒性,在H.264压缩和帧操作下优于被动取证方法,能够更有效地检测篡改区域。
Videos are prone to tampering attacks that alter the meaning and deceive the audience. Previous video forgery detection schemes find tiny clues to locate the tampered areas. However, attackers can successfully evade supervision by destroying such clues using video compression or blurring. This paper proposes a video watermarking network for tampering localization. We jointly train a 3D-UNet-based watermark embedding network and a decoder that predicts the tampering mask. The perturbation made by watermark embedding is close to imperceptible. Considering that there is no off-the-shelf differentiable video codec simulator, we propose to mimic video compression by ensembling simulation results of other typical attacks, e.g., JPEG compression and blurring, as an approximation. Experimental results demonstrate that our method generates watermarked videos with good imperceptibility and robustly and accurately locates tampered areas within the attacked version.
研究动机与目标
- 解决在现实场景中因H.264压缩等后期处理攻击破坏传统取证线索而导致的视频篡改检测挑战。
- 开发一种视频水印系统,即使在剧烈视频处理后也能实现篡改区域的精确定位。
- 通过在无可微分视频编解码器的情况下,使用集成攻击作为代理,模拟编解码器失真,提升对常见视频攻击的鲁棒性。
- 在水印视频中实现高不可察觉性,以确保视觉质量在社交媒体公开分享时不受影响。
- 提供一种主动取证解决方案,通过在视频中嵌入可检测信号,实现可靠的篡改检测与定位。
提出的方法
- 采用基于3D-UNet的编码器,以时空方式将水印嵌入视频帧,确保时间与空间上的一致性。
- 端到端训练解码器网络,从水印视频中预测篡改掩码,实现对修改区域的定位。
- 设计自定义的攻击模拟层,集成典型视频失真(如JPEG压缩、模糊化),以近似真实世界编解码器效应。
- 在对抗性训练中使用模拟攻击层,以提升水印对常见后期处理攻击的抗性。
- 通过联合训练整个系统,采用损失函数平衡水印不可察觉性(通过PSNR/SSIM衡量)与篡改定位准确性。
- 通过已知的、不可微分的失真组合,近似可微分视频编解码器的行为,从而避免对可微分编解码器的依赖。

实验结果
研究问题
- RQ1基于深度学习的水印系统能否在保持对真实世界视频压缩和后期处理攻击鲁棒性的同时,实现高不可察觉性?
- RQ2集成攻击模拟(如JPEG、模糊化)在近似真实视频编解码器行为方面,对对抗性训练的有效性如何?
- RQ3所提出的水印框架能否在视频压缩和帧操作下,优于被动取证方法检测篡改区域?
- RQ4与基于2D的水印方法相比,3D-UNet架构在时空一致性与鲁棒性方面提升程度如何?
- RQ5专用编解码器模拟器的引入是否显著提升了H.264压缩下篡改区域的定位准确性?
主要发现
- 所提出的RWVFD框架在YouTube-VOS数据集上实现了高不可察觉性,平均PSNR为37.78 dB,SSIM为0.987。
- 在H.264压缩(CRF=29)下,该方法在篡改区域定位任务中仍保持0.87的F1-score,表明其在高压缩比下仍具备强大鲁棒性。
- 消融实验表明,若移除3D-UNet,性能显著下降,在CRF=29时F1-score降至0.56。
- 编解码器模拟器至关重要:若移除该模块,CRF=23时F1-score降至0.80,表明其对压缩攻击鲁棒性的必要性。
- RWVFD优于被动取证方法(如MVSS和Xception),后者在编解码器攻击下因分布偏移而无法检测篡改区域。
- 该方法在帧删除和帧率变化攻击中实现了高精度与高召回率(F1-score ≥ 0.95),表明其对时间域操作具有强鲁棒性。
![Figure 2: Architectures of the encoder and decoder, which are based on the 3D-Unet [ 15 ] .](https://ar5iv.labs.arxiv.org/html/2207.03409/assets/x1.png)
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。