Skip to main content
QUICK REVIEW

[논문 리뷰] Membership Model Inversion Attacks for Deep Networks

Samyadeep Basu, Rauf Izmailov|arXiv (Cornell University)|2019. 10. 09.
Adversarial Robustness in Machine Learning참고 문헌 13인용 수 14
한 줄 요약

이 논문은 도메인 전문 지식을 활용하여 연결된 낮은 차원의 잠재 다양체 내에서 최적화함으로써, 손글씨 숫자나 의류 아이템과 같은 현실적이고 식별 가능한 클래스 표현을 생성하는 GAN 기반의 멤버십 모델 역공학 공격을 제안한다. 기존의 공격는 해석할 수 없는 출력을 낳지만, 이 방법은 의미 있는 샘플을 성공적으로 복원하여, 악성 사용자가 데이터 도메인에 대한 맥락적 지식을 가진 경우 딥 네트워크의 프라이버시 유출에 취약함을 보여준다.

ABSTRACT

With the increasing adoption of AI, inherent security and privacy vulnerabilities formachine learning systems are being discovered. One such vulnerability makes itpossible for an adversary to obtain private information about the types of instancesused to train the targeted machine learning model. This so-called model inversionattack is based on sequential leveraging of classification scores towards obtaininghigh confidence representations for various classes. However, for deep networks,such procedures usually lead to unrecognizable representations that are uselessfor the adversary. In this paper, we introduce a more realistic definition of modelinversion, where the adversary is aware of the general purpose of the attackedmodel (for instance, whether it is an OCR system or a facial recognition system),and the goal is to find realistic class representations within the corresponding lower-dimensional manifold (of, respectively, general symbols or general faces). To thatend, we leverage properties of generative adversarial networks for constructinga connected lower-dimensional manifold, and demonstrate the efficiency of ourmodel inversion attack that is carried out within that manifold.

연구 동기 및 목표

  • 기존의 모델 역공학 공격는 검색 공간의 고차원성과 부정확한 성격으로 인해 인식할 수 없고 사용할 수 없는 출력을 낳는 한계를 해결하기 위해.
  • 목표 모델의 응용 도메인에 대한 일반적 지식(예: OCR 또는 얼굴 인식)을 통합함으로써 의미 있는 대표 샘플을 회복할 수 있는지 조사하기 위해.
  • 특정 도메인의 다양한 데이터로 훈련된 GAN을 통해 생성된 연결된 낮은 차원의 다양체가 높은 신뢰도와 현실적인 클래스 표현을 향한 효과적이고 효율적인 최적화를 가능하게 함을 보여주기 위해.
  • 실제 데이터셋인 MNIST와 Fashion MNIST에 대한 제안된 방법의 효과성을 평가하여, 도메인 지식이 없는 표준 역공학 공격보다 우수함을 보여주기 위해.

제안 방법

  • 이 방법은 목표 응용 도메인(예: 손글씨 문자 또는 얼굴)의 데이터에 대한 연결된 낮은 차원의 다각형을 모델링하기 위해 생성적 적대적 네트워크(GAN)를 사용하여, 더 의미 있는 공간에서 제약을 가한 검색을 가능하게 한다.
  • GAN의 생성자 네트워크는 연속적인 잠재 공간(예: 정규 분포 노이즈)에서 실수 데이터 샘플로 매핑되며, 이는 실제 훈련 데이터와 구조적·의미적으로 유사하다.
  • 목표 분류기의 특정 클래스에 대한 신뢰도 점수를 최대화하기 위해 GAN의 잠재 공간에서 최적화를 수행하며, 레이블 신뢰도와 정규화를 통합한 미분 가능한 목적 함수를 사용한다.
  • 이 공격는 목표 모델에 백박스 액세스를 가정하며, 전체 고차원 입력 공간에서 직접 최적화하는 것의 부정확성을 피하기 위해 다각형 구조를 활용한다.
  • 이미지 품질 향상을 위해 ℓp 노름(p=1에서 6까지)을 정규화로 적용하지만, 실험 결과 최종 결과에 미치는 영향은 미미한 것으로 나타났다.
  • 이 방법은 MNIST와 Fashion MNIST 데이터셋에서 검증되었으며, GAN은 전체 데이터셋으로 훈련되어 역공학 검색을 위한 연결된 다각형을 생성한다.

실험 결과

연구 질문

  • RQ1악성 사용자가 목표 모델의 응용 도메인에 대해 도메인 특화 지식을 가진 경우, 딥 네트워크에 대한 모델 역공학 공격가 의미 있는, 식별 가능한 클래스 표현을 생성할 수 있는가?
  • RQ2GAN을 통해 연결된 낮은 차원의 잠재 다각형을 구성함으로써, 전체 입력 공간에서 직접 최적화하는 것에 비해 역공학 샘플의 품질과 해석 가능성은 향상되는가?
  • RQ3ℓp 정규화는 GAN 기반 역공학 프레임워크에서 역공학된 샘플의 시각적 품질을 어느 정도 향상시키는가?
  • RQ4목표 모델이 일부 클래스만으로 훈련된 경우, GAN 기반 접근법이 MNIST 및 Fashion MNIST와 같은 실세계 데이터셋에서 대표 샘플을 회복하는 데 얼마나 효과적인가?
  • RQ5GAN의 잠재 공간의 연결된 구조가 정확히 훈련 샘플이 포함되지 않은 경우에도 높은 신뢰도와 현실적인 표현을 찾는 데 활용될 수 있는가?

주요 결과

  • 제안된 GAN 기반 모델 역공학 공격는 악성 사용자가 도메인 지식을 가진 경우, 숫자나 의류 아이템과 같은 현실적이고 식별 가능한 클래스 표현을 성공적으로 복원한다. 이는 표준 공격가 인식할 수 없는 출력을 낳는 반면, 이 방법은 의미 있는 출력을 생성함을 보여준다.
  • 도메인 지식이 없을 경우, 전체 입력 공간에서 직접 최적화는 의미 있는 샘플을 생성하지 못하며, 그림 1에서 볼 수 있듯이 '5', '6', '9' 클래스의 역공학된 이미지는 식별할 수 없다.
  • 도메인 지식과 GAN 기반의 다각형 검색을 통해, 공격는 높은 신뢰도와 의미적으로 일관된 샘플을 생성한다. 이는 MNIST의 '0', '1', '3' 클래스에 대해 그림 2에서, Fashion MNIST의 'T-shirts', 'Coats', 'Sneakers' 클래스에 대해 그림 3에서 확인할 수 있다.
  • ℓp 노름(p=1에서 6까지)을 통한 정규화는 이미지 품질에 거의 영향을 주지 않아, GAN의 내재된 구조가 이미지가 현실적으로 보이도록 최적화를 제약하는 데 이미 효과적이라는 것을 시사한다.
  • GAN이 더 넓은 데이터 세트(예: 모든 MNIST 숫자 또는 모든 Fashion MNIST 클래스)로 훈련된 경우에도 공격는 효과를 유지하며, GAN 훈련 데이터에 명시적으로 포함되지 않은 타겟 클래스 표현을 복원할 수 있다.
  • 결과적으로 GAN은 실제 데이터 다각형의 내재 기하학과 일치하는 연결된 구조적 검색 공간을 제공하므로, 모델 역공학에 강력한 도구가 될 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.