Skip to main content
QUICK REVIEW

[논문 리뷰] Fourier Spectrum Discrepancies in Deep Network Generated Images

Tarik Dzanic, Karan Shah|arXiv (Cornell University)|2019. 11. 15.
Digital Media Forensic Detection참고 문헌 24인용 수 57
한 줄 요약

본 논문은 실제 이미지와 심층 네트워크로 생성된 이미지 간의 고주파 푸리에 스펙트럼 차이를 분석하고, 합성 이미지를 탐지하기 위해 스펙트럼 감소 매개변수를 활용한 적은 학습 데이터로 작동하는 분류기와 탐지기를 속이는 스펙트럼 합성 방법을 제안한다.

ABSTRACT

Advancements in deep generative models such as generative adversarial networks and variational autoencoders have resulted in the ability to generate realistic images that are visually indistinguishable from real images, which raises concerns about their potential malicious usage. In this paper, we present an analysis of the high-frequency Fourier modes of real and deep network generated images and show that deep network generated images share an observable, systematic shortcoming in replicating the attributes of these high-frequency modes. Using this, we propose a detection method based on the frequency spectrum of the images which is able to achieve an accuracy of up to 99.2% in classifying real and deep network generated images from various GAN and VAE architectures on a dataset of 5000 images with as few as 8 training examples. Furthermore, we show the impact of image transformations such as compression, cropping, and resolution reduction on the classification accuracy and suggest a method for modifying the high-frequency attributes of deep network generated images to mimic real images.

연구 동기 및 목표

  • GAN/VAE 생성 이미지의 신뢰할 수 있고 데이터 효율적인 탐지 필요성에 대한 동기 부여.
  • 여러 아키텍처에서 실제 이미지와 생성 이미지의 고주파 푸리에 특성 조사.
  • 적은 학습 샘플이 필요한 간단한 스펙트럼 기반 분류기 개발.
  • 해상도와 압축이 스펙트럼 기반 탐지에 미치는 영향 평가.
  • 스펙트럼 편집 방법을 제안하여 스펙트럼 기반 탐지기를 속이기.

제안 방법

  • 이미지 채널의 DC 정규화와 함께 이산 푸리에 변환을 계산한다.
  • 좌표를 정규화된 극 좌표 주파수 공간으로 변환하고 방위 평균화하여 축소된 스펙트럼 c(k_r)를 얻는다.
  • k_r ≥ k_T 인 경우 c(k_r) ≈ b1 (k_r/k_T)^{b2} 형태의 거듭제곱 감소를 적합화하여 고주파 매개변수 b1과 b2를 얻는다.
  • (b1, b2)에 대해 KNN 분류기를 사용하여 최소한의 학습 데이터로 실제 이미지와 위조 이미지를 구별한다.
  • 해상도 1024^2, 768^2, 256^2 및 압축 품질(100, 95, 85)에서 FFHQ 및 GAN/VAE 모델(StyleGAN, StyleGAN2, PGGAN, VQ-VAE2, ALAE)의 데이터 세트를 실험한다.
  • 딥 네트워크 이미지의 고주파 스펙트럼을 실제 이미지와 유사하게 보이도록 스펙트럼을 수정하는 합성 방법을 설명한다.

실험 결과

연구 질문

  • RQ1다양한 아키텍처에 걸쳐 실제 이미지와 심층 네트워크로 생성된 이미지를 고주파 푸리에 스펙트럼 특징으로 구별할 수 있는가?
  • RQ2해상도와 손실 압축이 스펙트럼 기반 탐지의 효과에 어떤 영향을 미치는가?
  • RQ3고주파 속성을 활용하여 위조 이미지를 탐지하기 위한 저데이터(적은 샷) 분류기가 가능할까?
  • RQ4고주파 스펙트럼을 의도적으로 변경하여 스펙트럼 기반 탐지기를 속일 수 있는가?
  • RQ5다른 생성 모델(GAN vs VAE)은 고주파 감소 패턴에 서로 다른 경향을 보이는가?

주요 결과

  • 실제 이미지는 대략 k_r^{-4}에 비례해 고주파 감소가 나타나고, 평탄해지기 전까지는 실제와 다르게 깊게 감소한다. 심층 네트워크 이미지(StyleGAN2를 제외한 일부 사례를 제외하고)는 더 느리게 감소(지수 < 1)한다.
  • 압축되지 않은 1024^2 이미지의 전체 분류 정확도는 최대 99.2%, 아키텍처별 정확도는 실험 A에서 최대 99.9%에 도달한다.
  • 압축은 판별력을 저하시킨다; 85% 품질에서 실제 이미지와 많은 GAN 생성 스펙트럼이 구별하기 어려워지지만 VQ-VAE2의 경우 일부 사례에서 구별 가능성이 남아 있다.
  • 해상도가 작아질수록 판별력은 감소하지만 감소 매개변수 분류기는 해상도에 맞춰 보정하면 강건함을 유지한다(예: 1024^2 대 768^2).
  • VAE 계열(VQ-VAE2)은 고주파 콘텐츠가 적은 경향이 있어 압축하에서 실제 이미지와 구별하기 더 어렵다.
  • 스펙트럼 합성 방법은 고주파 구성요소를 조정해 실제 목표 스펙트럼과 유사하게 만들어 보이는 탐지기를 속일 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.