Skip to main content
QUICK REVIEW

[논문 리뷰] On Detecting GANs and Retouching based Synthetic Alterations

Anubhav Jain, Richa Singh|arXiv (Cornell University)|2019. 01. 26.
Digital Media Forensic Detection참고 문헌 15인용 수 5
한 줄 요약

이 논문은 얼굴 토닝 및 GAN으로 생성된 이미지와 같은 합성 이미지 수정을 감지하기 위한 지도 학습 기반의 CNN 기반 방법을 제안한다. 패치 기반 특징 추출과 잔차 연결을 활용하여, 토닝 처리된 이미지에서 99.65%의 정확도와 GAN으로 생성된 이미지에서 99.83%의 정확도를 달성하며, 이는 이전의 방법들보다 뚜렷하게 뛰어나다.

ABSTRACT

Digitally retouching images has become a popular trend, with people posting altered images on social media and even magazines posting flawless facial images of celebrities. Further, with advancements in Generative Adversarial Networks (GANs), now changing attributes and retouching have become very easy. Such synthetic alterations have adverse effect on face recognition algorithms. While researchers have proposed to detect image tampering, detecting GANs generated images has still not been explored. This paper proposes a supervised deep learning algorithm using Convolutional Neural Networks (CNNs) to detect synthetically altered images. The algorithm yields an accuracy of 99.65% on detecting retouching on the ND-IIITD dataset. It outperforms the previous state of the art which reported an accuracy of 87% on the database. For distinguishing between real images and images generated using GANs, the proposed algorithm yields an accuracy of 99.83%.

연구 동기 및 목표

  • 얼굴 이미지의 합성 수정, 즉 토닝 처리 및 GAN 생성 콘텐츠를 감지하기 위한 강력한 딥 러닝 프레임워크를 개발하는 것.
  • 얼굴 인식 시스템과 사회적 복지에 악영향을 미치는 시각적으로 구분하기 어려운 이미지 수정 증가 문제를 다루는 것.
  • 강화된 특징 학습을 위해 패치 기반 CNN와 잔차 연결을 활용하여 기존의 감지 방법을 향상시키는 것.
  • 실제 토닝 처리된 이미지(ND-IIITD 데이터셋)와 GAN으로 생성된 이미지(StarGAN)에 대한 성능 평가를 수행하며, 손실 압축 조건 하에서도 검토하는 것.
  • 과적합을 피하기 위해 압축 특징에 특정하게 학습되지 않도록, 다양한 이미지 소스와 압축 잔여물에 대해 일반화되는 모델을 확보하는 것.

제안 방법

  • 지역적 특징 학습을 위해 입력 이미지에서 겹치지 않는 크기의 패치(64,64,3) 또는 (128,128,3)를 추출한다.
  • 계층적 국소 및 전반적 특징을 캡처하기 위해 ResNet에 영감을 받은 잔차 CNN 아키텍처를 활용하여 기울기 흐름과 성능을 향상시킨다.
  • 토닝 처리 또는 GAN 생성을 나타내는 이상치를 탐지하기 위해 임계값 설정 또는 SVM을 통한 패치 수준의 분류를 실시한다.
  • 최종 결정을 내리기 위해 다수결 투표 또는 SVM을 사용하여 패치 예측을 융합함으로써 이미지 수준의 분류를 수행한다.
  • 모델을 PNG 형식의 이미지로 미세 조정하여, 압축 전용 패턴을 학습하지 않는지 확인함으로써 압축 형식으로의 일반화를 보장한다.
  • 잔차 연결의 필요성을 검증하기 위해 추론 실험을 실시하여, 제거 시 성능이 크게 저하됨을 확인한다.

실험 결과

연구 질문

  • RQ1ND-IIITD 데이터셋의 이미지에서 깊이 있는 CNN이 토닝 처리된 얼굴 이미지를 고정밀도로 감지할 수 있는가?
  • RQ2제안된 방법은 특히 StarGAN에서 생성된 GAN 이미지에 대해 얼마나 잘 일반화되는가?
  • RQ3일상적인 실생활 상황인 손실 압축 조건 하에서도 모델이 높은 감지 정확도를 유지하는가?
  • RQ4잔차 연결이 합성 수정 감지에서 모델의 강건성과 성능에 얼마나 기여하는가?
  • RQ5압축 잔여물에 과적합되지 않고도 모델이 진짜 이미지와 합성 이미지를 구분할 수 있는가?

주요 결과

  • 제안된 방법은 ND-IIITD 데이터셋에서 토닝 처리된 얼굴 이미지를 99.65%의 정확도로 감지하며, 이는 이전 최고 성능(87%)을 크게 뛰어넘는 결과이다.
  • StarGAN에서 생성된 GAN 이미지에 대해서는 임계값 설정 기반으로 99.83%의 정확도, SVM 기반으로는 99.73%의 정확도를 기록하여 강력한 일반화 능력을 입증한다.
  • JPEG 압축 이미지(품질 요소 50)에서 SVM 기반으로는 96.33%의 정확도를 유지하지만, 임계값 설정 기반으로는 88.89%로 떨어지며, 이는 압축 조건 하에서 SVM의 우월성을 시사한다.
  • 추론 실험 결과, 잔차 연결을 제거할 경우 패치 수준 정확도는 97.83%로 떨어지고, 이미지 수준 정확도는 96.80%로 하락함을 확인하여, 잔차 연결의 핵심적 역할을 입증한다.
  • PNG 이미지로의 미세 조정 결과, 모델이 압축 전용 패턴을 학습하지 않음을 확인하였으며, 이는 압축 형식에서도 높은 성능 유지에 기여한다.
  • 다양한 프로브 간에서의 일반화 성능을 평가한 결과, 한 프로브에서 학습하고 다른 프로브에서 테스트할 경우, 임계값 설정 기반으로 99.73%의 테스트 정확도, SVM 기반으로는 99.91%의 정확도를 달성하여, 상호 프로브 변동에 대한 강건성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.