Skip to main content
QUICK REVIEW

[논문 리뷰] Adversarial Attacks on Co-Occurrence Features for GAN Detection

Michael Goebel, B. S. Manjunath|arXiv (Cornell University)|2020. 09. 16.
Adversarial Robustness in Machine Learning참고 문헌 28인용 수 4
한 줄 요약

이 논문은 공시성 특징 기반 GAN 검출기 대상으로서 처음으로 목표 지향적 적대적 공격을 제시하며, 모델 가중치를 알지 못한 채 이미지 통계를 조작하여 검출기를 속이는 그레이박스 공격을 도입한다. 이 공격은 검출 정확도를 98% 이상에서 4% 미만으로 낮춘다. 모델 지식을 모두 갖춘 경우 정확도를 0%로 낮출 수 있다.

ABSTRACT

Improvements in Generative Adversarial Networks (GANs) have greatly reduced the difficulty of producing new, photo-realistic images with unique semantic meaning. With this rise in ability to generate fake images comes demand to detect them. While numerous methods have been developed for this task, the majority of them remain vulnerable to adversarial attacks. In this paper, develop two novel adversarial attacks on co-occurrence based GAN detectors. These are the first attacks to be presented against such a detector. We show that our method can reduce accuracy from over 98% to less than 4%, with no knowledge of the deep learning model or weights. Furthermore, accuracy can be reduced to 0% with full knowledge of the deep learning model details.

연구 동기 및 목표

  • 공시성 기반 GAN 검출기의 취약성은 높은 정확도에도 불구하고 아직 탐색되지 않은 바, 이를 해결하기 위해.
  • 모델 가중치나 아키텍처를 알지 못한 채 공시성 통계를 조작하는 새로운 그레이박스 공격을 개발하기 위해.
  • 이 공격이 다른 GAN 검출 방법으로의 전이 가능성과 수정된 공시성 특징으로의 일반화를 평가하기 위해.
  • 기존의 적대적 훈련이 이 새로운 공격에 대해 충분히 보호하지 못함을 보여주기 위해, 특히 공격이 훈련 분포에 포함되지 않은 경우에 특히 그렇다.
  • 공격이 교차채널 공시성 검출기로 일반화됨을 보여주어 유사 검출 프레임워크에 광범위한 적용 가능성을 시사하기 위해.

제안 방법

  • 적대적 예제 생성을 위한 기울기 기반 최적화를 가능하게 하기 위해 이산 공시성 행렬의 미분 가능 공식을 제안한다.
  • 실제 이미지의 공시성 특징을 GAN 생성 이미지로 전이하여 검출기가 GAN 이미지를 진짜로 보이게 하는 그레이박스 공격을 설계한다.
  • 적대적 이미지의 공시성 행렬과 실제 이미지의 공시성 행렬 간의 L2 거리 최소화를 목표로 하는 손실 함수를 사용하여 효과적인 특징 전이를 가능하게 한다.
  • 모델 가중치를 알지 못한 상태에서도 입력 이미지의 픽셀 수준의 변형을 기울기 하강법으로 최적화하여 대상 공시성 행렬을 일치시킨다.
  • 교차채널 쌍(예: 빨간색-초록색, 빨간색-blue)을 포함한 공시성 행렬 계산 방식을 적응시켜 교차채널 공시성 검출기로의 공격을 확장한다.
  • 다양한 데이터셋과 검출기(예: ResNet18, MobileNet)에서 공격의 유효성을 검증하며, 훈련 및 공격 조건을 다양하게 설정한다.

실험 결과

연구 질문

  • RQ1손수 제작된 비미분 가능 특징에 의존하는 공시성 기반 GAN 검출기에게도 적대적 공격이 성공적으로 적용될 수 있는가?
  • RQ2모델 가중치나 아키텍처를 알지 못한 채 공시성 통계를 조작하는 그레이박스 공격이 얼마나 효과적으로 검출기를 속일 수 있는가?
  • RQ3다양한 GAN 검출 모델과 데이터셋에서 이 공격이 검출 정확도를 얼마나 효과적으로 낮출 수 있는가?
  • RQ4제안된 공격에 대해 적대적 훈련을 수행하면 강건성이 향상되는가? 다른 공격 유형과 비교했을 때 어떻게 다른가?
  • RQ5교차채널 또는 대각선 공시성 행렬과 같은 수정된 공시성 특징으로도 공격가능성이 일반화되는가?

주요 결과

  • 그레이박스 공시성 공격은 검출기의 모델 가중치나 아키텍처를 알지 못한 채 GAN 이미지의 검출 정확도를 98% 이상에서 4% 미만으로 낮춘다.
  • 모델에 대한 완전한 지식이 있는 경우 기울기 하강법을 통해 공시성 행렬을 직접 최적화함으로써 검출 정확도를 0%로 낮출 수 있다.
  • 공격은 교차채널 공시성 검출기로 일반화되어, 공격 테스트 세트에서 정확도를 97.4%에서 13.1%로 낮춘다.
  • 적대적 재훈련이 이루어지지 않은 상태에서 공격은 다른 GAN 검출기의 평균 성능을 약 18% 감소시킨다.
  • 그레이박스 공시성 공격에 대해 적대적 훈련을 수행하면 강건성이 크게 향상되며, MobileNet 모델은 모든 테스트 세트에서 98% 이상의 정확도를 달성한다.
  • 그레이박스 공시성 공격에 대해 재훈련하지 않은 검출기는 여전히 매우 취약하여, λ=0 공격 세트에서 정확도가 5% 이하로 떨어지며 심각한 보안 격차를 드러낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.