[논문 리뷰] Generalizable Synthetic Image Detection via Language-guided Contrastive Learning
이 논문은 일반화된 합성 이미지 검출을 위한 언어 유도형 대비 학습 프레임워크인 LASTED를 제안한다. 의미적 텍스트 레이블(예: '실사 사진', '합성 그림' 등)을 이미지에 보강하고, 검출을 식별 작업으로 설정함으로써 LASTED는 최신 기술 수준을 초월하는 일반화 성능을 달성하며, 미사용된 생성 모델에서 +22.66% 정확도 및 +15.24% AUC 향상을 기록한다.
The heightened realism of AI-generated images can be attributed to the rapid development of synthetic models, including generative adversarial networks (GANs) and diffusion models (DMs). The malevolent use of synthetic images, such as the dissemination of fake news or the creation of fake profiles, however, raises significant concerns regarding the authenticity of images. Though many forensic algorithms have been developed for detecting synthetic images, their performance, especially the generalization capability, is still far from being adequate to cope with the increasing number of synthetic models. In this work, we propose a simple yet very effective synthetic image detection method via a language-guided contrastive learning. Specifically, we augment the training images with carefully-designed textual labels, enabling us to use a joint visual-language contrastive supervision for learning a forensic feature space with better generalization. It is shown that our proposed LanguAge-guided SynThEsis Detection (LASTED) model achieves much improved generalizability to unseen image generation models and delivers promising performance that far exceeds state-of-the-art competitors over four datasets. The code is available at https://github.com/HighwayWu/LASTED.
연구 동기 및 목표
- 점점 더 현실적으로 되는 AI 생성 이미지를 감지하는 데 있어 다양한 미사용 합성 모델을 포함한 핵심 과제를 해결하기 위해.
- 기존의 분류 기반 접근 방식이 분포 외 생성 모델에서 실패하는 점을 고려해 검출기의 일반화 능력을 향상시키기 위해.
- 더 강력하고 특징적인 표현 학습을 위한 언어 감독과 대비 학습을 활용하는 포렌식 검출 방법을 개발하기 위해.
- 합성 이미지 검출을 다중 클래스 분류 작업이 아닌 식별 문제로 재정의함으로써, 제한된 데이터에서의 성능 향상을 위해.
제안 방법
- 정교하게 설계된 텍스트 레이블인 '실사 사진', '실사 그림', '합성 사진', '합성 그림'을 사용해 훈련 이미지를 보강하여 이미지-텍스트 쌍을 생성한다.
- 일치하는 이미지-텍스트 쌍을 정렬하고 의미적 개념을 분리하기 위해 대비 학습을 사용해 공동 이미지-텍스트 인코더를 훈련시킨다.
- 구체적인 클래스 예측이 아닌, 이미지가 동일한 카테고리(실사 또는 합성)에 속하는지 여부를 판단하는 식별 작업으로 검출을 설정한다.
- 이전 연구에서 사용된 최종 선형 분류기 대신 특징 추출 헤드를 도입하여 특징 표현 학습에 최적화된 구조를 구현한다.
- 긍정적인 이미지-텍스트 쌍 간 유사도를 극대화하고 부정적인 쌍 간 유사도를 최소화하기 위해 대비 손실을 사용함으로써 강력한 표현 학습을 가능하게 한다.
- CLIP 유사 아키텍처를 활용해 이미지 및 텍스트의 이중 인코더를 사용함으로써, 미사용 모델에 대한 제로샷 일반화를 가능하게 한다.
실험 결과
연구 질문
- RQ1언어 유도형 대비 학습은 다양한 미사용 생성 모델을 포함한 합성 이미지 검출기의 일반화 능력을 향상시키는가?
- RQ2합성 이미지 검출을 다중 클래스 분류가 아닌 식별 작업으로 재정의하는 것이 성능 향상과 강건성 향상에 기여하는가?
- RQ3실사 이미지에 자연어 애너테이션이 없는 상황에서 정교하게 설계된 텍스트 레이블이 포렌식 표현 학습을 위한 효과적인 감독 신호가 될 수 있는가?
- RQ4GAN 및 디퓨전 모델 생성 이미지에서 LASTED는 최신 기술 수준의 방법 대비 정확도 및 AUC 측면에서 어떻게 비교되는가?
- RQ5제안된 방법은 의료 또는 위성 영상과 같은 새로운 이미지 유형으로의 일반화 능력이 어느 정도인가?
주요 결과
- 미사용 이미지 생성 모델에서 LASTED는 최신 기술 수준의 경쟁자 대비 +22.66% 정확도 향상 및 +15.24% AUC 향상을 기록한다.
- GAN, DM, 딥페이크 모델을 포함한 10개의 다양한 테스트 케이스에서 평균 AP가 97.5%로 높은 수준을 유지한다.
- SAN 및 딥페이크 데이터셋에서 기존 검출기들이 낮은 일반화 성능를 보이는 상황에서도 LASTED는 뚜렷한 승리를 거두었다.
- 식별 기반 설정 덕분에 제한된 훈련 데이터에서조차도 매우 구별 가능한 특징을 추출할 수 있었다.
- 텍스트 레이블을 통한 언어 감독 사용이 의미적 분리 및 포렌식 표현 최적화를 향상시켰다.
- 다양한 이미지 유형으로의 일반화 능력이 뛰어나지만, 의료 또는 위성 영상과 같은 새로운 도메인에서는 추가 훈련 데이터가 없을 경우 성능 저하가 발생할 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.