Skip to main content
QUICK REVIEW

[논문 리뷰] Performing Co-Membership Attacks Against Deep Generative Models

Kin Sum Liu, Chaowei Xiao|arXiv (Cornell University)|2018. 05. 24.
Adversarial Robustness in Machine Learning참고 문헌 25인용 수 6
한 줄 요약

이 논문은 VAE 및 GAN과 같은 딥 생성 모델을 대상으로 하는 새로운 프라이버시 공격인 공회원 공격(co-membership attacks)을 제안한다. 이 공격은 잠재 공간에서 입력 데이터를 재구성하는 데 목적이 있는 공격자 네트워크를 훈련시켜 수행된다. 제안된 방법은 이전 공격들보다 뛰어난 성능을 보이며, 단일 인스턴스 공격에 비해 공회원 공격이 훨씬 더 효과적임을 입증하고, VAE가 GAN보다 공격에 더 취약함을 드러낸다.

ABSTRACT

In this paper we propose a new membership attack method called co-membership attacks against deep generative models including Variational Autoencoders (VAEs) and Generative Adversarial Networks (GANs). Specifically, membership attack aims to check whether a given instance x was used in the training data or not. A co-membership attack checks whether the given bundle of n instances were in the training, with the prior knowledge that the bundle was either entirely used in the training or none at all. Successful membership attacks can compromise the privacy of training data when the generative model is published. Our main idea is to cast membership inference of target data x as the optimization of another neural network (called the attacker network) to search for the latent encoding to reproduce x. The final reconstruction error is used directly to conclude whether x was in the training data or not. We conduct extensive experiments on a variety of datasets and generative models showing that: our attacker network outperforms prior membership attacks; co-membership attacks can be substantially more powerful than single attacks; and VAEs are more susceptible to membership attacks compared to GANs.

연구 동기 및 목표

  • 공개된 이후에도 깊이 있는 생성 모델(VAE 및 GAN 포함)의 프라이버시 취약성을 조사한다.
  • 분류기와 달리 상호작용 가능한 쿼리 메커니즘이 없는 생성 모델에 초점을 맞춘 멤버십 공격 연구의 격차를 메운다.
  • 모델 훈련 데이터에 포함되어 있거나 모두 포함되어 있지 않은 n개의 인스턴스 묶음에 대한 공회원 지식을 활용하여 공격 정확도를 향상시키는 새로운 공격 프레임워크를 개발한다.
  • 재구성 오차를 멤버십 지표로 사용하는 비지도, 종단 간 공격자 네트워크를 제안하여 타겟 데이터를 재구성하기 위해 잠재 코드를 최적화한다.
  • 생성 모델에서 모델 일반화, 데이터 다양성, 멤버십 프라이버시 泄露 사이의 트레이드오프를 평가한다.

제안 방법

  • 재구성 손실 Δ(Gθ(z), x)에 대한 경사 하강법을 사용하여, 타겟 입력 x를 가능한 한 잘 재구성할 수 있도록 잠재 코드 z를 최적화하는 공격자 네트워크 A를 훈련한다.
  • 멤버십 추론을 재구성 작업으로 재정의한다: 만약 공격자 네트워크가 x에 대해 낮은 재구성 오차를 달성할 수 있다면, 이는 x가 훈련 데이터에 포함되어 있었음을 시사한다.
  • 공회원 공격로 확장하기 위해, 공격자 네트워크를 동시에 n개의 인스턴스 묶음을 재구성하도록 공동 최적화하여, 여러 타겟 간의 공유 정보를 활용한다.
  • 공격자 네트워크의 최종 재구성 오차를 이진 분류기로 사용한다: 낮은 오차는 훈련 세트에 속함을 의미한다.
  • WGAN 및 MNIST, CelebA, SVHN에서 훈련된 VAE와 GAN 아키텍처를 사용하여 VAE와 GAN 모두에 이 방법을 적용한다.
  • 어려운 재구성 데이터 포인트를 선택하기 위해 적대적 샘플링(adversarial sampling)을 도입하여, 증가된 다양성이 멤버십 공격 성공률을 높일 수 있음을 시연한다.

실험 결과

연구 질문

  • RQ1공회원 공격는 깊이 있는 생성 모델에서 단일 인스턴스 공격에 비해 멤버십 추론 정확도를 크게 향상시키는가?
  • RQ2재구성 기반 공격자 네트워크는 VAE 및 GAN에서 이전의 멤버십 공격 방법에 비해 어떻게 성능을 내는가?
  • RQ3VAE는 GAN보다 멤버십 공격에 더 취약한가? 그리고 이러한 차이를 설명하는 구조적 또는 최적화적 차이가 무엇인가?
  • RQ4어려운 샘플링을 통한 훈련 데이터의 적대적 선택은 얼마나 모델 다양성을 향상시키며, 프라이버시 泄露 위험은 증가시키는가?
  • RQ5모델 일반화(다양성)와 멤버십 프라이버시 사이에 트레이드오프가 존재하는가? 그리고 이러한 양측을 균형 잡는 데 최적화된 모델을 설계할 수 있는가?

주요 결과

  • 제안된 공격자 네트워크는 VAE 및 GAN 모두에서 이전의 방법보다 높은 멤버십 추론 정확도를 달성한다. 특히 공회원 설정에서 두드러진 성능 향상을 보였다.
  • 공회원 공격는 단일 인스턴스 공격보다 뚜렷이 뛰어나며, 여러 데이터 포인트의 공동 지식이 재구성 정밀도와 공격 성공률을 향상시킴을 입증했다.
  • VAE는 GAN보다 멤버십 공격에 더 취약한 편이다. 이는 명시적인 가능도 최대화와 더 부드러운 잠재 공간 덕분일 가능성이 높다. 이는 재구성에 유리한 조건를 제공한다.
  • 어려운 재구성 데이터 포인트를 선택하는 적대적 샘플링은 생성 샘플의 산산이 흩어지는 정도를 높이며, 이는 다양성이 향상되었음을 시사한다. 그러나 동시에 멤버십 공격 성공률도 증가시킨다.
  • 적대적 샘플링된 데이터로 훈련된 모델는 데이터 산산이 흩어지는 정도 측면에서 더 높은 일반화 성능를 보였지만, 멤버십 추론에 더 취약함을 보여, 다양성과 프라이버시 사이에 갈등이 있음을 시사한다.
  • 공격자 네트워크의 재구성 오차는 모델 기울기나 레이블에 접근할 수 없더라도 멤버십 상태를 신뢰할 수 있고 효과적으로 나타내는 지표로 기능한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.