[논문 리뷰] Robustness of AI-Image Detectors: Fundamental Limits and Practical Attacks
이 논문은 AI-이미지 검출기의 기본적인 강건성 한계를 조사하며, 워터마킹 및 분류기 기반 딥페이크 검출기 중심으로 다룬다. 저자는 저항성 편집이 작은 워터마킹 방법에서 애뮬레이션 오차와 스푸핑 오차 사이의 이론적 트레이드오프를 드러내며, 확산 정제 공격이 검출기 성능을 심각하게 악화시켜 AUROC를 0.65 이하로 떨어뜨릴 수 있음을 입증한다. 동시에 고편집 워터마킹 방법에 대해 모델 대체 공격을 제안한다. 연구는 스푸핑 취약성도 폭 드러내며, 이론적 및 실험적 검증을 통해 딥페이크 검출기에서 강건성-신뢰성 트레이드오프를 확립한다.
In light of recent advancements in generative AI models, it has become essential to distinguish genuine content from AI-generated one to prevent the malicious usage of fake materials as authentic ones and vice versa. Various techniques have been introduced for identifying AI-generated images, with watermarking emerging as a promising approach. In this paper, we analyze the robustness of various AI-image detectors including watermarking and classifier-based deepfake detectors. For watermarking methods that introduce subtle image perturbations (i.e., low perturbation budget methods), we reveal a fundamental trade-off between the evasion error rate (i.e., the fraction of watermarked images detected as non-watermarked ones) and the spoofing error rate (i.e., the fraction of non-watermarked images detected as watermarked ones) upon an application of diffusion purification attack. To validate our theoretical findings, we also provide empirical evidence demonstrating that diffusion purification effectively removes low perturbation budget watermarks by applying minimal changes to images. The diffusion purification attack is ineffective for high perturbation watermarking methods where notable changes are applied to images. In this case, we develop a model substitution adversarial attack that can successfully remove watermarks. Moreover, we show that watermarking methods are vulnerable to spoofing attacks where the attacker aims to have real images identified as watermarked ones, damaging the reputation of the developers. In particular, with black-box access to the watermarking method, a watermarked noise image can be generated and added to real images, causing them to be incorrectly classified as watermarked. Finally, we extend our theory to characterize a fundamental trade-off between the robustness and reliability of classifier-based deep fake detectors and demonstrate it through experiments.
연구 동기 및 목표
- AI 생성 이미지 검출기의 강건성, 특히 워터마킹 및 분류기 기반 딥페이크 검출기의 강건성 분석.
- 대비 공격 하에서 저편집 워터마킹 방법의 애뮬레이션 오차율과 스푸핑 오차율 사이의 기본 트레이드오프 규명.
- 다양한 워터마킹 체계에 대해 확산 정제 및 모델 대체 공격의 효과성 평가.
- 이론적 및 실험적 방법을 통해 분류기 기반 딥페이크 검출기의 강건성-신뢰성 트레이드오프 분석.
- 실제 이미지를 위조하여 워터마킹된 것으로 잘못 분류시키는 실질적 스푸핑 공격의 구현 — 개발자 신뢰도 손상
제안 방법
- 이론적 분석을 통해 확산 정제가 이미지 분포에 미치는 영향을 바탕으로, 워터마킹된 이미지와 비워터마킹된 이미지 분포 간의 워셔스타인 거리와 오차 함수를 사용해 애뮬레이션 오차율과 스푸핑 오차율의 합에 하한을 도출한다.
- 실험적 검증을 위해 확산 정제를 활용: 가우시안 노이즈를 추가하고, 확산 모델을 통해 노이즈를 제거함으로써 저편집 워터마킹을 최소한의 이미지 변화로 제거한다.
- 고편집 워터마킹에 대해 모델 대체 대비 공격을 개발: 대체 분류기를 학습한 후, PGD를 통해 속임수 이미지를 생성한다.
- 딥페이크 검출기의 강건성-신뢰성 트레이드오프를 정량화하기 위해 잠재 공간의 노이즈 수준를 다양하게 조절해 모델을 학습하고, 증가하는 추론 노이즈 하에서 AUROC를 측정한다.
- 실제 이미지에 추가될 수 있는 워터마킹된 노이즈 이미지를 생성하는 스푸핑 공격을 제안: 이 이미지를 추가함으로써 실제 이미지가 워터마킹된 것으로 잘못 분류되게 한다.
- 실험은 ResNet-18 및 VGG-16-BN 백본을 사용해 DeepFakes 및 FaceSwap 데이터셋에서 수행되며, 다양한 노이즈 수준에서 AUROC 및 강건성 지표를 평가한다.

실험 결과
연구 질문
- RQ1확산 정제 공격 하에서 저편집 워터마킹 방법의 애뮬레이션 오차율과 스푸핑 오차율 사이의 기본 트레이드오프는 무엇인가?
- RQ2확산 정제는 최소한의 시각적 변화로 이미지의 워터마킹을 효과적으로 제거할 수 있으며, 그로 인해 검출기 성능은 어느 정도 악화되는가?
- RQ3원본 검출기가 블랙박스일 경우, 모델 대체 대비 공격이 고편집 워터마킹을 얼마나 효과적으로 제거할 수 있는가?
- RQ4분류기 기반 딥페이크 검출기의 내재된 강건성-신뢰성 트레이드오프는 무엇이며, 모델의 강건성과 노이즈 수준에 따라 어떻게 변화하는가?
- RQ5워터마킹 시스템에 블랙박스 액세스만으로도 실재 이미지를 위조하여 워터마킹된 것으로 잘못 분류시키는 스푸핑 공격이 가능한가?
주요 결과
- 확산 정제 공격은 저편집 워터마킹 방법의 AUROC를 0.65 이하로 낮춰, 극도로 미미한 이미지 편집으로도 성능이 심각하게 악화됨을 입증한다.
- 이론적 하한은 워터마킹된 이미지와 비워터마킹된 이미지 분포 간의 워셔스타인 거리에 따라 애뮬레이션 오차율과 스푸핑 오차율의 합이 하한을 지닌다는 것을 보여준다.
- 모델 대체 공격은 고편집 워터마킹을 성공적으로 제거하며, 외관상 변화가 뚜렷한 경우에도 취약성을 드러낸다.
- 스푸핑 공격는 워터마킹된 노이즈 이미지를 생성해 실제 이미지에 추가함으로써, 이를 워터마킹된 것으로 잘못 분류하게 하며, 이는 개발자 신뢰도에 손상을 줄 수 있다.
- 딥페이크 검출기의 강건성-신뢰성 트레이드오프는 실험적으로 검증되었으며, 노이즈 주입을 통한 검출기 강건성 증가에 따라 AUROC가 감소함을 확인하여 이론적 하한을 뒷받침한다.
- 작은 이미지 공간의 편집이 딥 네트워크의 잠재 공간에서 큰 편집을 유도할 수 있으며, 이는 검출기 특징에 대한 효과적인 대비 공격을 가능하게 한다.
![Figure 2: Lower bound on the sum of evasion and spoofing errors of image watermarks against diffusion purification attack from Theorem 1 . The beta schedule for the diffusion model is linear in the range $[0.0008,0.0120]$ .](https://ar5iv.labs.arxiv.org/html/2310.00076/assets/x2.png)
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.