Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Photo-Realistic Visible Watermark Removal with Conditional Generative Adversarial Networks

Li Xiang, Chan Lu|arXiv (Cornell University)|2019. 05. 30.
Advanced Steganography and Watermarking Techniques참고 문헌 16인용 수 4
한 줄 요약

이 논문은 수상한 수준의 수많은 다양한 수평 워터마크가 존재하는 실제 환경에서 사진 수준의 현실적인 가시 워터마크 제거를 위한 조건부 생성 적대적 네트워크(cGAN) 기반 프레임워크를 제안한다. 워터마크가 알려져 있지 않은 상황에서, 워터마크 이미지에 조건부가 된 패치 기반 판별자와 적대적 손실, 픽셀 단위의 콘텐츠 손실(L1 + 인지적 손실)을 결합함으로써, 기존 최고 수준의 방법들보다 더 현실적이며 잔여 무늬가 없는 복원 결과를 생성한다. 인간 평가를 통해 검증된 결과, 시각적 품질이 크게 향상됨을 확인할 수 있다.

ABSTRACT

Visible watermark plays an important role in image copyright protection and the robustness of a visible watermark to an attack is shown to be essential. To evaluate and improve the effectiveness of watermark, watermark removal attracts increasing attention and becomes a hot research top. Current methods cast the watermark removal as an image-to-image translation problem where the encode-decode architectures with pixel-wise loss are adopted to transfer the transparent watermarked pixels into unmarked pixels. However, when a number of realistic images are presented, the watermarks are more likely to be unknown and diverse (i.e., the watermarks might be opaque or semi-transparent; the category and pattern of watermarks are unknown). When applying existing methods to the real-world scenarios, they mostly can not satisfactorily reconstruct the hidden information obscured under the complex and various watermarks (i.e., the residual watermark traces remain and the reconstructed images lack reality). To address this difficulty, in this paper, we present a new watermark processing framework using the conditional generative adversarial networks (cGANs) for visible watermark removal in the real-world application. The proposed method enables the watermark removal solution to be more closed to the photo-realistic reconstruction using a patch-based discriminator conditioned on the watermarked images, which is adversarially trained to differentiate the difference between the recovered images and original watermark-free images. Extensive experimental results on a large-scale visible watermark dataset demonstrate the effectiveness of the proposed method and clearly indicate that our proposed approach can produce more photo-realistic and convincing results compared with the state-of-the-art methods.

연구 동기 및 목표

  • 사전 지식이 없이도 알려지지 않은 다양한 복잡한 가시 워터마크를 실제 이미지에서 효과적으로 제거하는 문제를 해결하기 위해.
  • 워터마크 제거된 이미지의 시각적 현실감을 향상시켜 잔여 무늬를 줄이고, 외관적으로 자연스러운 결과를 얻기 위해.
  • 다양한 워터마크 패턴과 투명도 수준에 일반화할 수 있는 강력한 종단 간 프레임워크를 개발하기 위해.
  • 패치 기반 판별자를 사용한 적대적 훈련이 기존의 이미지 수준의 판별자보다 더 사진 수준의 현실감 있는 결과를 얻을 수 있음을 보여주기 위해.
  • 기존 표준 지표(예: PSNR, SSIM)보다 인간 시각적 인지에 중점을 둔 새로운 워터마크 제거 기준을 설정하기 위해.

제안 방법

  • 프레임워크는 조건부 GAN(cGAN)을 활용하며, 생성자는 워터마크가 포함된 입력 이미지에 조건을 받고 워터마크가 제거된 출력을 생성한다.
  • 패치 기반 판별자를 도입하여 국소적인 이미지 패치의 현실감을 평가하고, 입력 워터마크 이미지에 조건을 받음으로써 실제 이미지와 생성된 이미지를 구분한다.
  • 생성자는 적대적 손실(실제감 향상용)과 콘텐츠 손실(L1 + 인지적 손실)을 조합한 하이브리드 손실 함수를 사용하여 구조적 및 의미적 세부 정보를 유지한다.
  • 인지적 손실은 사전 훈련된 VGG 네트워크의 특징을 사용하여 생성된 이미지가 고수준 특징 공간에서 진짜 이미지와 일치하도록 한다.
  • 백프로파게이션를 사용한 엔드 투 엔드 훈련과 Adam 최적화를 통해 생성자와 판별자를 동시에 최적화한다.
  • 패치 기반 판별자는 이미지 수준의 판별자보다 가볍고 빠르며, 대규모 이미지에서의 효율적인 훈련과 추론을 가능하게 한다.

실험 결과

연구 질문

  • RQ1사전 지식 없이도 다양한 알려지지 않은 가시 워터마크를 효과적으로 제거할 수 있는 cGAN 기반 프레임워크는 가능한가?
  • RQ2패치 기반 판별자를 도입함으로써 이미지 수준의 판별자보다 워터마크 복원 이미지의 사진 수준의 현실감을 높이고 잔여 무늬를 줄일 수 있는가?
  • RQ3적대적 손실과 콘텐츠 손실(L1 + 인지적 손실)의 조합이 단순 픽셀 수준의 손실만을 사용한 경우보다 더 시각적으로 설득력 있는 결과를 낼 수 있는가?
  • RQ4PSNR와 DSSIM 점수가 유사할 수 있음에도 불구하고, 인간의 시각적 인지 측면에서 제안된 방법은 최고 수준의 방법들과 비교해 어떻게 성능을 냈는가?
  • RQ5복잡하고 투명하거나 반투명한 워터마크를 가진 실제 이미지에 대해 제안된 프레임워크는 어느 정도 일반화 성능를 보일 수 있는가?

주요 결과

  • 제안된 방법은 LVW 데이터셋에서 평균 평가 점수(MOS) 4.08을 기록하여, Cheng 등이 제안한 방법(MOS = 3.23)보다 유의미하게 높은 시각적 품질을 확보함을 확인했다.
  • 패치 기반 판별자는 PSNR 30.69, DSSIM 0.045를 기록하여 이미지 기반 판별자(PSNR: 29.72, DSSIM: 0.052)보다 더 뛰어난 국소적 현실감과 복원 정확도를 보였다.
  • qualitative 비교(그림 4)를 통해 인간 관찰자가 제안된 방법의 결과를 선호하는 등, 잔여 워터마크 흔적을 최소화한 시각적으로 설득력 있는 결과를 생성했다.
  • 적대적 손실 구성 요소는 현실감 향상에 핵심적인 역할을 하였으며, 이를 제거한 모델은 눈에 띄는 아티팩트와 자연스럽지 않은 질감을 보였다.
  • 패치 기반 판별자는 파라미터 수가 적고 추론 속도가 빨라 이미지 수준의 판별자보다 더 효율적이고 확장 가능했으며, 실제 환경 적용에 적합했다.
  • Cheng 등과 비교해 PSNR와 DSSIM가 약간 낮았음에도 불구하고, 제안된 방법은 더 높은 MOS를 기록하여, 인간 평가가 표준 지표보다 시각적 품질을 더 잘 반영함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.