Skip to main content
QUICK REVIEW

[논문 리뷰] Semantics Preserving Adversarial Learning

Ousmane Dia, Elnaz Barshan|arXiv (Cornell University)|2019. 03. 10.
Adversarial Robustness in Machine Learning참고 문헌 39인용 수 6
한 줄 요약

이 논문은 변분 추론을 통해 입력의 저차원 기하 다양체(맨니폴드)를 학습하고, 그 맨니폴드 내에서 그람-슈미트 기반의 불변성에 기반한 변형을 적용하며, 엔드 투 엔드 적인 적대적 최적화를 수행함으로써 의미를 유지하는 적대적 예제를 생성하는 의미 유지 적대적 공격 프레임워크를 제안한다. 이는 이미지와 텍스트 전반에서 인식 및 의미적 일관성을 유지하면서도, 인증된 방어와 비인증된 방어 양쪽 모두에 대해 높은 성공률을 달성한다.

ABSTRACT

While progress has been made in crafting visually imperceptible adversarial examples, constructing semantically meaningful ones remains a challenge. In this paper, we propose a framework to generate semantics preserving adversarial examples. First, we present a manifold learning method to capture the semantics of the inputs. The motivating principle is to learn the low-dimensional geometric summaries of the inputs via statistical inference. Then, we perturb the elements of the learned manifold using the Gram-Schmidt process to induce the perturbed elements to remain in the manifold. To produce adversarial examples, we propose an efficient algorithm whereby we leverage the semantics of the inputs as a source of knowledge upon which we impose adversarial constraints. We apply our approach on toy data, images and text, and show its effectiveness in producing semantics preserving adversarial examples which evade existing defenses against adversarial attacks.

연구 동기 및 목표

  • 기존 공격 방법에서 원본 입력과 적대적 예제 간의 의미 일관성 부족 문제를 해결하기 위해.
  • 적대적 예제 생성 과정에서 입력의 의미를 유지함으로써 변형이 의미적으로 유의미하게 유지되도록 하는 방법을 개발하기 위해.
  • 강력한 방어를 우회할 수 있는 적대적 예제를 생성함으로써 복원성 및 의미적 유사성이 원본 입력과 유사한 상태를 유지하는 방식으로 공격의 강건성 평가를 향상시키기 위해.
  • 기하 맨니폴드 제약 조건을 활용해 잠재 공간에서 효율적이고 엔드 투 엔드로 적대적 공격 예제를 생성할 수 있도록 하기 위해.

제안 방법

  • 입력 데이터의 저차원 기하 요약(맨니폴드)를 학습하기 위해 느슨한 가우시안 사전 확률를 사용한 변분 추론을 적용하여, 강한 분포 가정 없이 의미를 포괄한다.
  • 학습된 맨니폴드 내에서 유지되는 변형을 보장하기 위해 그람-슈미트 기반의 변형 전략을 적용함으로써 기하학적 및 의미적 구조를 유지한다.
  • 입력 공간($\mathcal{X}$)이 아닌 잠재 표현 공간($\mathcal{Z}$)에서 작동함으로써 계산 비용을 감소시키고 의미적 충실도를 향상시킨다.
  • 백색 상자 기반의 엔드 투 엔드 최적화 프레임워크를 통해 학습된 맨니폴드 요소에 대해 적대적 제약 조건을 도입하여, 분류 손실을 최대화하면서도 맨니폴드 소속을 유지한다.
  • 잠재 코드에서 입력을 재구성할 수 있도록 조건부 VAE 유사 아키텍처를 활용하고, 재구성 기반 정규화를 가능하게 하는 디코더 $p_\phi$를 도입한다.
  • 맨니폴드의 내재 기하학적 구조를 활용하여 제약 없고 토폴로지 인식 가능한 검색 공간을 정의함으로써 균일한 $\ell_p$-구역 제약 조건을 피한다.

실험 결과

연구 질문

  • RQ1강력한 방어를 우회하면서도 원본 입력의 의미적 내용을 유지하는 적대적 예제를 생성할 수 있는가?
  • RQ2입력 데이터의 기하학적 구조를 어떻게 모델링할 수 있을까? 이를 통해 적대적 변형이 의미적으로 일관성을 유지할 수 있도록 할 수 있는가?
  • RQ3입력 공간 공격과 비교해 볼 때, 잠재 맨니폴드 공간에서 작동하는 것이 인증된 방어에 대한 공격 성공률을 향상시키는가?
  • RQ4제안된 방법이 시각 및 자연어 처리 작업 모두에서 의미적으로 타당한 적대적 예제를 어느 정도 생성할 수 있는가?

주요 결과

  • MNIST에서 40단계 PGD ResNet에 대해 100%의 성공률를 기록하였으며, 인간 평가에서 PGD, Song 등 [2018], Zhao 등 [2018b]를 모두 능가하였다.
  • MNIST에서 인간 평가자들이 100%의 의미적 타당성(질문1: 예)과 원본 입력과의 유사도(질문2: 예)를 기록하였으며, 이는 PGD의 66.8% 대비 유의미하게 높았다.
  • 인증된 방어( Raghunathan 등 [2018] 및 Kolter & Wong [2017])에 대해 각각 100%의 성공률 기록하였으며, Song 등 [2018]의 86.6% 및 88.6%를 초월하였다.
  • CelebA에서 인간 평가자들의 100%가 적대적 예제를 의미적으로 타당하다고 평가하였으며(질문1: 예), 97%가 원본 이미지와 유사하다고 평가하였다.
  • SNLI 텍스트 분류 과제에서 83.7%의 의미적 타당성과 79.6%의 유사도를 기록하였으며, Zhao 등 [2018b]의 60.4% 및 56.3%를 모두 능가하였다.
  • 이 방법은 인증된 방어와 비인증된 방어 양쪽을 우회하면서도 높은 의미적 충실도를 유지하는 적대적 예제를 성공적으로 생성하여, 다양한 모odal에서의 강건성과 일반화 능력을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.