[논문 리뷰] Property Inference Attacks Against GANs
이 논문은 GAN에 대한 최초의 성질 추론 공격을 제안하며, 모델 파arameter나 학습 데이터에 접근할 수 없더라도 생성된 샘플만을 사용하여 전체 학습 데이터셋의 거시적 성질—예를 들어 인구 통계적 비율—을 추론할 수 있도록 한다. 이 공격은 전체 흑상자 및 부분 흑상자 설정 모두에서 높은 정확도를 달성하며, 후자의 경우 쿼리 비용을 줄이기 위한 새로운 최적화 프레임워크를 도입한다.
While machine learning (ML) has made tremendous progress during the past decade, recent research has shown that ML models are vulnerable to various security and privacy attacks. So far, most of the attacks in this field focus on discriminative models, represented by classifiers. Meanwhile, little attention has been paid to the security and privacy risks of generative models, such as generative adversarial networks (GANs). In this paper, we propose the first set of training dataset property inference attacks against GANs. Concretely, the adversary aims to infer the macro-level training dataset property, i.e., the proportion of samples used to train a target GAN with respect to a certain attribute. A successful property inference attack can allow the adversary to gain extra knowledge of the target GAN's training dataset, thereby directly violating the intellectual property of the target model owner. Also, it can be used as a fairness auditor to check whether the target GAN is trained with a biased dataset. Besides, property inference can serve as a building block for other advanced attacks, such as membership inference. We propose a general attack pipeline that can be tailored to two attack scenarios, including the full black-box setting and partial black-box setting. For the latter, we introduce a novel optimization framework to increase the attack efficacy. Extensive experiments over four representative GAN models on five property inference tasks show that our attacks achieve strong performance. In addition, we show that our attacks can be used to enhance the performance of membership inference against GANs.
연구 동기 및 목표
- 멤버십 추론 외에도 생성 모델, 특히 GAN에 대한 프라이버시 및 보안 분석의 부족을 해결하기 위해.
- 모델 파rameter나 학습 데이터에 접근할 수 없을 때도 공격자가 GAN의 학습 데이터셋의 거시적 성질을 추론할 수 있는지 조사하기 위해.
- 전체 흑상자 및 부분 흑상자 설정 모두에서 효과적인 일반화 가능한 공격 파이프라인을 개발하기 위해.
- 성질 추론이 멤버십 추론과 같은 더 고급 공격의 기초가 될 수 있음을 보여주기 위해.
- GAN에서 편향된 학습 데이터를 탐지할 수 있는 공정성 감사 메커니즘을 제공하기 위해.
제안 방법
- 일반화된 공격 파이프라인 제안: 타겟 GAN에 쿼리를 보내 생성된 샘플을 확보한 후, 성질 분류기로 타겟 속성(예: 성별, 피부 톤)에 따라 샘플을 레이블링.
- 전체 흑상자 설정에서는 무작위로 샘플링한 잠복 코드를 사용해 다양한 샘플을 생성하여 성질 분류에 활용.
- 부분 흑상자 설정에서는 쿼리당 정보 수확을 극대화하기 위해 최적화된 잠복 코드 집합을 생성하는 새로운 최적화 프레임워크 도입.
- 잠복 코드의 최적화를 도와주기 위해 영향 모델을 활용하여 공격 효율성을 높이고 쿼리 횟수를 감소.
- 성질 추론 작업을 연속적인 비율(예: 흰 피부의 여성 30%)을 예측하는 회귀 문제로 모델링함으로써 이진 분류가 아닌 더 넓은 범위의 정보를 추론.
- 예측된 성질을 기반으로 전체 데이터셋의 특성, 예를 들어 인구 통계적 분포나 데이터 편향을 추론.
실험 결과
연구 질문
- RQ1모델 파arameter나 학습 데이터에 접근할 수 없고 생성된 샘플만을 사용할 때도 공격자가 GAN의 학습 데이터셋의 거시적 성질을 추론할 수 있는가?
- RQ2무작위 샘플링만 허용되는 전체 흑상자 설정에서 성질 추론의 효과성은 어떠한가?
- RQ3제한된 쿼리 수에서 최적화된 잠복 코드 생성 프레임워크가 부분 흑상자 설정에서 공격 성능을 향상시킬 수 있는가?
- RQ4성질 추론이 GAN에 대한 멤버십 추론 공격을 얼마나 향상시킬 수 있는가?
- RQ5성질 추론이 편향된 학습 데이터를 탐지할 수 있는 공정성 감사 도구로 활용될 수 있는가?
주요 결과
- 제안된 성질 추론 공격는 다양한 GAN 모델과 데이터셋에서 성별, 피부 톤 분포와 같은 학습 데이터셋 성질을 높은 정확도로 추론한다.
- CelebA 데이터셋에서 성별 예측 작업을 수행한 결과, 학습 세트 내 흰 피부의 여성 비율을 추정할 때 평균 절대 오차가 0.05 이하로 나타났다.
- 최적화된 잠복 코드를 사용한 부분 흑상자 공격는 랜덤 샘플링 대비 유사하거나 더 높은 성능을 달성하기 위해 필요한 쿼리 수를 크게 감소시켰다.
- 제한된 쿼리 예산 조건에서도 공격는 강력한 안정성과 정확도를 유지하며, 전체 및 부분 흑상자 설정에서 기준 방법들을 능가하는 성능을 보였다.
- 성질 추론 결과는 멤버십 추론 공격 향상에 활용될 수 있으며, 이는 고급 프라이버시 공격의 기초 기법으로서의 잠재력을 시사한다.
- 이 방법은 편향된 학습 데이터 분포를 성공적으로 탐지하여, GAN에 대한 공정성 감사 도구로서의 유용성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.