Skip to main content
QUICK REVIEW

[논문 리뷰] Improved Techniques for Model Inversion Attacks

Si Chen, Ruoxi Jia|arXiv (Cornell University)|2021. 05. 04.
Adversarial Robustness in Machine Learning참고 문헌 17인용 수 15
한 줄 요약

이 논문은 딥 뉴럴 네트워크에서 훈련 데이터의 재구성 품질을 크게 향상시키는 고도화된 모델 역행렬 공격 기법을 제안한다. 공개 데이터 분포와 비공개 데이터 간의 큰 분포 이탈이 존재하더라도 상태의 기술 수준을 달성할 수 있도록, GAN 훈련을 역행렬에 맞게 맞춤 설정하고, 단일 점 재구성 대신 비공개 데이터 분포를 모델링함으로써, 기존의 최적화되지 않은 알고리즘 설계에 기인한 성능 저하 문제를 해결한다.

ABSTRACT

Model inversion (MI) attacks in the whitebox setting are aimed at reconstructing training data from model parameters. Such attacks have triggered increasing concerns about privacy, especially given a growing number of online model repositories. However, existing MI attacks against deep neural networks (DNNs) have large room for performance improvement. A natural question is whether the underperformance is because the target model does not memorize much about its training data or it is simply an artifact of imperfect attack algorithm design? This paper shows that it is the latter. We present a variety of new techniques that can significantly boost the performance of MI attacks against DNNs. Recent advances to attack DNNs are largely attributed to the idea of training a general generative adversarial network (GAN) with potential public data and using it to regularize the search space for reconstructed images. We propose to customize the training of a GAN to the inversion task so as to better distill knowledge useful for performing attacks from public data. Moreover, unlike previous work that directly searches for a single data point to represent a target class, we propose to model private data distribution in order to better reconstruct representative data points. Our experiments show that the combination of these techniques can lead to state-of-the-art attack performance on a variety of datasets and models, even when the public data has a large distributional shift from the private data.

연구 동기 및 목표

  • 모델의 기억력 제한 때문이 아니라, 최적화되지 않은 알고리즘 설계로 인해 기존의 모델 역행렬 공격이 딥 뉴럴 네트워크에 대해 성능이 열등한 문제를 해결한다.
  • 작업에 특화된 GAN 맞춤화를 통해 공개 데이터를 더 효율적으로 활용하여 공격의 효과를 높인다.
  • 단일 점 재구성에서 벗어나 비공개 데이터의 기저 분포를 모델링하여 더 대표적이고 정확한 이미지 생성을 가능하게 한다.
  • 공개 데이터 분포가 비공개 훈련 데이터와 크게 다를 경우에도 강건한 성능을 유지한다.
  • 다양한 데이터셋과 모델 아키텍처에서 최첨단 수준의 모델 역행렬 성능을 입증한다.

제안 방법

  • 공개 데이터로부터 유용한 지식을 더 잘 추출할 수 있도록, 모델 역행렬에 특화된 생성적 적대적 네트워크(GAN)의 훈련을 맞춤 설정한다.
  • 일반적인 GAN을 역행렬 목표에 맞는 작업 인식 GAN으로 대체함으로써, 생성된 이미지의 품질과 관련성을 향상시킨다.
  • 단일 데이터 포인트를 목표로 하는 대신, 비공개 데이터 분포를 모델링함으로써 더 정확하고 대표적인 재구성 가능성을 확보한다.
  • 맞춤형 GAN을 정규화 요소로 활용하여 역행렬 과정에서 탐색 공간을 제약함으로써 수렴성과 정밀도를 향상시킨다.
  • GAN 기반 사전 지식을 기울기 기반 최적화와 통합하여 모델 파라미터에서 이미지를 재구성한다.
  • 공개 데이터의 통계적 성질을 활용하여 분포 이탈이 존재하더라도 역행렬 과정을 안내한다.

실험 결과

연구 질문

  • RQ1모델 역행렬에 맞게 GAN 훈련을 맞춤 설정할 경우, 일반적인 GAN을 사용하는 것보다 재구성 품질이 크게 향상되는가?
  • RQ2비공개 데이터 분포를 모델링할 경우, 개별 데이터 포인트를 재구성하는 것보다 더 나은 역행렬 결과를 얻을 수 있는가?
  • RQ3공개 데이터가 비공개 훈련 데이터와 큰 분포 이탈을 보일 경우, 제안된 기법의 효과는 어떠한가?
  • RQ4다양한 데이터셋과 모델에서 제안된 방법이 기존 최첨단 기법보다 얼마나 뛰어난 성능을 보이는가?
  • RQ5성능 향상의 원인은 더 나은 최적화인지, 아니면 맞춤형 GAN 사전 지식에 의한 개선된 인도크티브 바이어스인가?

주요 결과

  • 제안된 방법은 다양한 데이터셋과 모델 아키텍처에서 최첨단 수준의 모델 역행렬 성능을 달성한다.
  • 맞춤형 GAN 훈련은 표준 GAN 기반 기준선 대비 재구성 정밀도를 크게 향상시킨다.
  • 비공개 데이터 분포를 모델링할 경우, 단일 점 재구성보다 더 대표적이고 현실적인 재구성 이미지를 얻을 수 있다.
  • 공개 데이터 분포가 비공개 데이터와 상당히 다를 경우에도 공격가 효과를 유지하여 강건성을 입증한다.
  • 분포 모델링과 작업 특화 GAN 정규화의 조합이 시각적 품질과 정량적 지표 양면에서 측정 가능한 향상을 이룬다.
  • 특히 데이터 정합성이 제한된 도전적인 환경에서 재구성 정확도와 다양성 측면에서 이전 방법들을 능가한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.