Skip to main content
QUICK REVIEW

[논문 리뷰] A Transferable Anti-Forensic Attack on Forensic CNNs Using A Generative Adversarial Network

Xinwei Zhao, Chen Chen|arXiv (Cornell University)|2021. 01. 23.
Digital Media Forensic Detection참고 문헌 77인용 수 7
한 줄 요약

이 논문은 변조된 이미지에서 증거를 제거하면서도 눈에 띄지 않는 왜곡을 유지하는 생성적 적대적 네트워크(GAN)를 사용해 포렌식 CNN에 대한 이식 가능한 반포렌식 공격을 제안한다. 다양한 사전 훈련된 대체 CNN들을 앙상블하여 생성기의 훈련을 수행함으로써, 알려지지 않은 아키텍처와 데이터셋 간에도 강력한 이식성을 확보하여, 상태기반 포렌식 CNN을 블랙박스 환경에서도 평균 76%의 성공률로 속임성공한다.

ABSTRACT

With the development of deep learning, convolutional neural networks (CNNs) have become widely used in multimedia forensics for tasks such as detecting and identifying image forgeries. Meanwhile, anti-forensic attacks have been developed to fool these CNN-based forensic algorithms. Previous anti-forensic attacks often were designed to remove forgery traces left by a single manipulation operation as opposed to a set of manipulations. Additionally, recent research has shown that existing anti-forensic attacks against forensic CNNs have poor transferability, i.e. they are unable to fool other forensic CNNs that were not explicitly used during training. In this paper, we propose a new anti-forensic attack framework designed to remove forensic traces left by a variety of manipulation operations. This attack is transferable, i.e. it can be used to attack forensic CNNs are unknown to the attacker, and it introduces only minimal distortions that are imperceptible to human eyes. Our proposed attack utilizes a generative adversarial network (GAN) to build a generator that can attack color images of any size. We achieve attack transferability through the use of a new training strategy and loss function. We conduct extensive experiment to demonstrate that our attack can fool many state-of-art forensic CNNs with varying levels of knowledge available to the attacker.

연구 동기 및 목표

  • 기존의 포렌식 CNN에 대한 반포렌식 공격에서 낮은 이식성이라는 핵심적 한계를 해결하기 위해.
  • 공격자가 타겟 포렌식 CNN의 아키텍처나 훈련 데이터를 알지 못하는 블랙박스 환경에서도 효과적으로 작동하는 공격을 개발하기 위해.
  • 반포렌식 공격을 당한 이미지가 실제 변조되지 않은 이미지의 포렌식 통계를 모방하면서도 시각적 품질을 유지하도록 하기 위해.
  • 포렌식 CNN에 대한 이식 가능한 공격이 가능함을 입증하여, 이전에 내재적인 비이식성으로 간주되었던 가정에 도전하기 위해.

제안 방법

  • 공격은 변조된 이미지에서 포렌식 증거를 제거하고 실제 변조되지 않은 이미지의 통계를 재현하는 GAN 기반 생성기를 사용한다.
  • 사전 훈련된 대체 CNN들의 앙상블—다양한 아키텍처와 데이터셋에서 훈련된 것들—이 생성기 훈련 중에 사용되어 진정한 이미지의 일반적인 포렌식 패턴을 학습하도록 유도한다.
  • 생성기 손실 함수는 대체 CNN들의 특징 공간에서 생성된 이미지와 실제 변조되지 않은 이미지 간의 차이를 최소화하도록 설계된다.
  • 훈련 과정을 통해 생성기는 훈련 앙상블에 포함되지 않은 포렌식 CNN들조차도 실제 이미지로 잘못 분류하도록 하는 이미지를 학습한다.
  • 완전 컨볼루션 생성기 아키텍처를 사용함으로써, 어떤 크기의 이미지도 스케일러블하게 처리할 수 있다.
  • 공격는 공격자가 타겟 CNN의 아키텍처나 훈련 데이터를 알지 못하고, 훈련에도 사용하지 않는 엄격한 블랙박스 조건에서 평가된다.

실험 결과

연구 질문

  • RQ1GAN 기반 반포렌식 공격가 다양한 포렌식 CNN 아키텍처와 훈련 데이터셋 간에 높은 이식성을 달성할 수 있는가?
  • RQ2공격자가 타겟 모델의 아키텍처나 훈련 데이터에 접근할 수 없는 상황에서 포렌식 CNN을 얼마나 효과적으로 속일 수 있는가?
  • RQ3대체 CNN들의 앙상블을 사용함으로써 반포렌식 공격의 일반화 능력과 이식성은 향상되는가?
  • RQ4생성된 반포렌식 공격 이미지는 여러 포렌식 CNN을 회피할 수 있을 뿐 아니라 높은 시각적 품질을 유지할 수 있는가?

주요 결과

  • 제안된 공격는 타겟 CNN의 아키텍처나 훈련 데이터를 전혀 알지 못하는 블랙박스 환경에서 45,000개의 이미지 패치에 대해 평균 76%의 공격 성공률를 기록했다.
  • 변조 탐지에 있어서 공격 성공률는 89%에 도달하여, 탐지 회피에 매우 효과적임을 입증했다.
  • 변조 분류에 있어서 성공률는 71%였으며, 이는 공격가 CNN들이 잘못된 변조 유형으로 잘못 분류하도록 속일 수 있음을 시사한다.
  • 파rameterization 작업에 있어서는 68%의 성공률를 기록하여, 변조 작업의 특정 파라미터를 은폐하는 데 성공했다.
  • 평균 PSNR 46.76와 SSIM 0.996는 반포렌식 공격를 당한 이미지가 원본 변조되지 않은 이미지와 시각적으로 구별되지 않음을 나타낸다.
  • 훈련에 사용된 대체 CNN들이 다른 아키텍처를 가지거나 타겟의 아키텍처를 포함하지 않더라도, 다른 데이터셋(I-set 등)에서 훈련된 포렌식 CNN들을 성공적으로 속였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.