[논문 리뷰] Robust Watermarking for Video Forgery Detection with Improved Imperceptibility and Robustness
이 논문은 3D-UNet 기반의 엔드 투 엔드 비디오 워터마킹 프레임워크인 RWVFD를 제안한다. 이는 정밀하게 통합된 비가시 워터마크를 삽입하고, 강력한 위변조 지역 국지화 기능을 동시에 제공한다. JPEG, 블러링 등의 다양한 왜곡을 통합하여 비디오 압축 및 후처리 공격을 시뮬레이션함으로써, 높은 비가시성(PSNR: 37.78 dB, SSIM: 0.987)과 강력한 내구성을 확보하였으며, H.264 압축 및 프레임 조작 상황에서도 수동 포렌식 기법보다 우수한 성능을 보였다.
Videos are prone to tampering attacks that alter the meaning and deceive the audience. Previous video forgery detection schemes find tiny clues to locate the tampered areas. However, attackers can successfully evade supervision by destroying such clues using video compression or blurring. This paper proposes a video watermarking network for tampering localization. We jointly train a 3D-UNet-based watermark embedding network and a decoder that predicts the tampering mask. The perturbation made by watermark embedding is close to imperceptible. Considering that there is no off-the-shelf differentiable video codec simulator, we propose to mimic video compression by ensembling simulation results of other typical attacks, e.g., JPEG compression and blurring, as an approximation. Experimental results demonstrate that our method generates watermarked videos with good imperceptibility and robustly and accurately locates tampered areas within the attacked version.
연구 동기 및 목표
- H.264 압축과 같은 후처리 공격으로 인해 전통적인 포렌식 증거가 손상되는 실제 환경에서 비디오 위변조 탐지를 해결한다.
- 강력한 비디오 처리 조건에서도 위변조된 영역을 정확히 국지화할 수 있는 비디오 워터마킹 시스템을 개발한다.
- 가용한 비디오 코덱 왜곡을 시뮬레이션함으로써, 미분 가능한 비디오 코덱 없이도 일반적인 비디오 공격에 대한 내구성을 향상시킨다.
- 워터마킹된 비디오의 시각적 품질을 유지하기 위해 높은 비가시성을 확보한다.
- 위변조 탐지 및 국지화를 위한 신뢰할 수 있는 방법을 제공하는 활성 포렌식 솔루션을 제시한다.
제안 방법
- 시공간적으로 일관성을 확보하면서, 3D-UNet 기반 인코더를 사용해 워터마크를 비디오 프레임에 삽입한다.
- 워터마킹된 비디오에서 위변조 마스크를 예측하기 위해 디코더 네트워크를 엔드 투 엔드로 훈련시켜, 수정된 영역를 국지화한다.
- 일반적인 비디오 왜곡(예: JPEG 압축, 블러링)을 통합하여 실생활 비디오 코덱 효과를 근사하는 맞춤형 공격 시뮬레이션 레이어를 설계한다.
- 적대적 훈련 중에 시뮬레이션된 공격 레이어를 사용하여 워터마크의 일반적인 후처리 공격에 대한 내구성을 향상시킨다.
- 워터마크의 비가시성(PSNR/SSIM 기반)과 위변조 국지화 정확도를 균형 잡는 손실 함수를 사용해 전체 시스템을 공동으로 훈련시킨다.
- 미분 가능한 비디오 코덱이 없음을 활용하여, 알려진 비미분 가능 왜곡의 조합을 통해 그 행동을 근사한다.

실험 결과
연구 질문
- RQ1딥 러닝 기반 워터마킹 시스템은 실생활 비디오 압축 및 후처리 공격에 대해 높은 비가시성을 유지하면서도 내구성을 확보할 수 있는가?
- RQ2JPEG, 블러링 등의 통합 공격 시뮬레이션은 적대적 훈련을 위해 실제 비디오 코덱의 행동을 얼마나 잘 근사하는가?
- RQ3제안된 워터마킹 프레임워크는 비디오 압축 및 프레임 조작 상황에서 수동 포렌식 기법보다 위변조 영역 탐지 성능이 뛰어나게 되는가?
- RQ42D 기반 워터마킹 대비 3D-UNet 아키텍처가 시공간 일관성과 내구성 향상에 얼마나 기여하는가?
- RQ5전용 코덱 시뮬레이터의 포함 여부가 H.264 압축 조건에서 위변조 영역 국지화 정확도에 상당한 영향을 미치는가?
주요 결과
- 제안된 RWVFD 프레임워크는 YouTube-VOS 데이터셋에서 평균 PSNR 37.78 dB, SSIM 0.987을 기록하여 높은 비가시성을 확보하였다.
- H.264 압축(CRF=29) 조건에서도 위변조 국지화 F1-스코어 0.87을 유지하여, 높은 압축 수준에서도 강력한 내구성을 입증하였다.
- 제거 실험 결과, 3D-UNet 제거 시 CRF=29에서 F1-스코어가 0.56으로 급격히 감소하여 성능 저하가 발생함을 확인하였다.
- 코덱 시뮬레이터의 중요성이 입증됨: CRF=23에서 제거 시 F1-스코어가 0.80으로 감소하여, 이는 압축에 대한 내구성 확보를 위해 필수적임을 시사한다.
- MVSS 및 Xception과 같은 수동 포렌식 기법은 분포 이탈로 인해 코덱 공격 상황에서 위변조 영역을 탐지하지 못하지만, RWVFD는 이를 초월하는 성능을 보였다.
- 프레임 삭제 및 프레임 레이트 변경 공격 상황에서도 높은 정밀도와 재현율(F1-스코어 ≥ 0.95)을 확보하여 시간적 조작에 대한 내구성을 입증하였다.
![Figure 2: Architectures of the encoder and decoder, which are based on the 3D-Unet [ 15 ] .](https://ar5iv.labs.arxiv.org/html/2207.03409/assets/x1.png)
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.