Skip to main content
QUICK REVIEW

[논문 리뷰] Generating Semantic Adversarial Examples via Feature Manipulation

Shuo Wang, ‪Surya Nepal‬|arXiv (Cornell University)|2020. 01. 06.
Adversarial Robustness in Machine Learning참고 문헌 33인용 수 10
한 줄 요약

이 논문은 변분 오토인코더(VAE)의 분리된 잠재 코드를 조작하여 의미적으로 유의미하고 자연스러운 왜곡을 생성하는 새로운 적대적 공격을 제안한다. 폰트 스타일이나 크기와 같은 주제에 영향을 받지 않는 속성에 초점을 맞춰, 정교한 제어와 높은 이식성을 갖춘 적대적 예제를 생성하며, 블랙박스 설정에서도 성능을 발휘한다. 이는 일반화된, 이미지에 종속되지 않는 의미적 적대적 예제가 존재함을 보여준다.

ABSTRACT

The vulnerability of deep neural networks to adversarial attacks has been widely demonstrated (e.g., adversarial example attacks). Traditional attacks perform unstructured pixel-wise perturbation to fool the classifier. An alternative approach is to have perturbations in the latent space. However, such perturbations are hard to control due to the lack of interpretability and disentanglement. In this paper, we propose a more practical adversarial attack by designing structured perturbation with semantic meanings. Our proposed technique manipulates the semantic attributes of images via the disentangled latent codes. The intuition behind our technique is that images in similar domains have some commonly shared but theme-independent semantic attributes, e.g. thickness of lines in handwritten digits, that can be bidirectionally mapped to disentangled latent codes. We generate adversarial perturbation by manipulating a single or a combination of these latent codes and propose two unsupervised semantic manipulation approaches: vector-based disentangled representation and feature map-based disentangled representation, in terms of the complexity of the latent codes and smoothness of the reconstructed images. We conduct extensive experimental evaluations on real-world image data to demonstrate the power of our attacks for black-box classifiers. We further demonstrate the existence of a universal, image-agnostic semantic adversarial example.

연구 동기 및 목표

  • 기존 픽셀 수준의 적대적 공격에서의 해석 가능성과 제어 가능성 부족 문제를 해결하기 위해.
  • 시각적 자연스러움과 인간이 이해할 수 있는 해석 가능성을 유지하는 구조적, 속성 수준의 적대적 공격을 개발하기 위해.
  • VAE의 잠재 공간에서 의미적 속성(예: 폰트 스타일, 크기)을 정교하게 분리하여 조작할 수 있도록 하기 위해.
  • 다양한 클래스 간에 일반화되고 이미지에 종속되지 않는 의미적 적대적 예제의 존재성과 이식성을 입증하기 위해.
  • 의미적으로 유의미한 왜곡에 대한 블랙박스 분류기의 강건성 평가를 위해.

제안 방법

  • 각 차원이 특정 의미적 속성에 대응하는 분리된 잠재 표현을 학습하기 위해 분리된 변분 오토인코더(VAE)를 활용한다.
  • 두 가지 비지도 분리 기법인 벡터 기반 분리 표현과 특징 맵 기반 분리 표현을 적용하여 제어력과 재구성 품질을 향상시킨다.
  • 객체의 정체성을 유지하면서 주제에 영향을 받지 않는 속성(예: 폰트 스타일, 크기)에 해당하는 특정 잠재 코드를 왜곡하여 적대적 예제를 생성한다.
  • 단일의, 이미지에 종속되지 않는 적대적 왜곡을 생성하기 위해 일반화된 왜곡 전략을 적용한다.
  • 분리된 잠재 공간을 활용하여 속성 조작 중 시각적 전이가 부드럽고 자연스럽게 유지되도록 보장한다.
  • 실제 이미지 데이터셋을 사용하여 블랙박스 분류기의 공격 성능을 평가하며, 오분류율과 이식성 등을 측정한다.

실험 결과

연구 질문

  • RQ1분리된 잠재 표현은 의미적 속성 수준에서 정교하고 해석 가능하며 자연스러운 적대적 왜곡을 가능하게 하는가?
  • RQ2왜곡이 특정 입력에 맞추어지지 않더라도 의미적 적대적 예제가 다양한 이미지 간에 얼마나 잘 이식되는가?
  • RQ3제안된 방법은 일반화되고 이미지에 종속되지 않는 의미적 적대적 예제를 얼마나 효과적으로 생성하는가?
  • RQ4공격이 시각적 타당성과 의미적 일관성을 유지하면서도 블랙박스 분류기를 성공적으로 속일 수 있는가?
  • RQ5잠재 공간의 분리 정도가 적대적 공격의 제어력과 강건성에 어떤 영향을 미치는가?

주요 결과

  • 제안된 방법은 시각적으로 자연스럽고 의미적으로 의미 있는 적대적 예제를 성공적으로 생성하였으며, 왜곡은 폰트 스타일이나 크기와 같은 주제에 영향을 받지 않는 속성에 국한되어 있다.
  • 공격은 블랙박스 분류기에서 높은 오분류율을 달성하여 다양한 이미지와 모델 간에 강력한 이식성을 보였다.
  • 일반화되고 이미지에 종속되지 않는 의미적 적대적 예제를 성공적으로 생성하였으며, 데이터셋 내 여러 샘플을 높은 신뢰도로 오분류시켰다.
  • 특징 맵 기반 분리 표현이 벡터 기반 접근 방식에 비해 재구성 품질과 시각적 부드러움 측면에서 뛰어난 성능을 보였다.
  • 공격 대상 모델이 생성 모델의 학습 데이터에 노출되지 않은 경우에도 공격가능성이 유지되어, 블랙박스 환경에서의 강건성을 확인하였다.
  • 이 방법은 깊이 신경망이 인간이 인지하기 어려운 정교한 속성 수준의 왜곡에 취약함을 드러내었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.