Skip to main content
QUICK REVIEW

[논문 리뷰] Generating Realistic Unrestricted Adversarial Inputs using Dual-Objective GAN Training.

Isaac Dunn, Tom Melham|arXiv (Cornell University)|2019. 05. 07.
Adversarial Robustness in Machine Learning인용 수 5
한 줄 요약

이 논문은 목표 분류기의 오류를 유도하면서도 실제 데이터와 구분이 가지 않도록 하는 이중 목적 GAN 프레임워크를 제안한다. 이는 생성자(generator)가 고정된 목표 분류기의 오류를 유도하도록 훈련되고, 동시에 공훈련된 판별기(discriminator)에 의해 실제 데이터와 구분이 가지 않도록 훈련된다. 인간 평가 결과, 이러한 적대적 예제가 잘못된 것으로 올바르게 식별되는 비율은 약 50%에 그쳐 중간 정도의 현실감을 보임.

ABSTRACT

The correctness of deep neural networks is well-known to be vulnerable to small, 'adversarial' perturbations of their inputs. Although studying these attacks is valuable, they do not necessarily conform to any real-world threat model. This has led to interest in the generation of (and robustness to) unrestricted adversarial inputs, which are not constructed as small perturbations of correctly-classified ground-truth inputs. We introduce a novel algorithm to generate realistic unrestricted adversarial inputs, in the sense that they cannot reliably be distinguished from the training dataset by a human. This is achieved by modifying generative adversarial networks: a generator neural network is trained to construct examples that deceive a fixed target network (so they are adversarial) while also deceiving the usual co-training discriminator network (so they are realistic). Our approach is demonstrated by the generation of unrestricted adversarial inputs for a trained image classifier that is robust to perturbation-based attacks. We find that human judges are unable to identify which image out of ten was generated by our method about 50 percent of the time, providing evidence that they are moderately realistic.

연구 동기 및 목표

  • 작은, 인지하기 어려운 변형에 의존하는 적대적 공격의 한계를 해결하기 위해, 실제 위협 모델과 일치하지 않는다.
  • 목표 모델에 의해 잘못 분류되면서도 인간에게 시각적으로 현실적인 제한 없는 적대적 입력을 생성하기 위해.
  • 단순한 변형을 넘어서 적대적 예제의 현실감을 향상시켜 실제 위협 시나리오에 더 부합되게 하기 위해.
  • 적대적 성공과 데이터 현실감을 동시에 최적화하는 수정된 GAN 아키텍처를 사용한 훈련 프레임워크를 개발하기 위해.

제안 방법

  • 생성자 네트워크는 고정된 목표 분류기의 오류를 유도할 수 있도록 훈련되어, 오분류를 보장한다.
  • 동일한 생성자는 공훈련된 판별기 네트워크를 속이도록 훈련되어, 훈련 데이터 분포와 유사한 현실감 있는 샘플을 생성한다.
  • 생성자는 목표 분류기의 적대적 손실과 데이터 판별기의 적대적 손실을 조합한 이중 목적 손실을 통해 최적화된다.
  • 생성자 훈련 중 목표 분류기는 고정되어 있어, 생성된 입력이 특정하게 오분류를 유도하도록 설계된다.
  • 훈련 과정은 표준 GAN 훈련 동역학을 활용하지만, 분류기 속임과 데이터 판별기 속임을 위한 이중 감독 신호를 도입한다.
  • 이 방법은 제한 없는 적대적 예제를 생성할 수 있게 하여, 작은 정돈된 입력의 변형에 국한되지 않는 현실적인 공격 시나리오의 범위를 넓힌다.

실험 결과

연구 질문

  • RQ1목표 분류기에게 매우 속임수를 쓰면서도 인간 관찰자에게는 현실적으로 보이는 적대적 예제를 생성할 수 있는가?
  • RQ2GAN 기반 생성자가 실제 데이터와 구별이 가지 않는 제한 없는 적대적 입력을 어느 정도 생성할 수 있는가?
  • RQ3이중 목적 훈련 체계는 전통적인 적대적 훈련에 비해 현실감과 공격 효과성 측면에서 어떻게 비교되는가?
  • RQ4이 방법으로 생성된 적대적 예제를 인간 평가자가 신뢰성 있게 식별할 수 있는가, 이는 그들의 현실감을 시사하는가?
  • RQ5제한 없는 적대적 예제 생성에서 적대적 성공과 데이터 현실감 사이의 상호 상충 관계는 어떠한가?

주요 결과

  • 인간 평가자들이 10개의 이미지 중에서 적대적 예제를 정확히 식별하지 못한 비율이 약 50%였으며, 이는 중간 정도의 현실감을 의미한다.
  • 생성된 적대적 예제는 전통적인 변형 기반 공격에 강건한 목표 분류기를 성공적으로 속였다.
  • 이중 목적 훈련 프레임워크는 적대적 입력 생성과 현실적인 샘플 생산 사이의 균형을 성공적으로 달성했다.
  • 이 방법은 청소년 이미지의 작은 변형에 국한되지 않는 제한 없는 적대적 입력을 생성하여 현실적인 공격 시나리오의 범위를 넓혔다.
  • 공훈련된 판별기는 생성자에게 훈련 데이터 분포와 시각적으로 일치하는 샘플을 생성하도록 효과적으로 이끌었다.
  • 결과적으로, 수정된 GAN 아키텍처에 이중 감독을 적용함으로써 현실적이고 제한 없는 적대적 예제를 생성할 수 있음을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.