Skip to main content
QUICK REVIEW

[논문 리뷰] A Probabilistic Fluctuation based Membership Inference Attack for Diffusion Models

Wenjie Fu, Huandong Wang|arXiv (Cornell University)|2023. 08. 23.
Adversarial Robustness in Machine LearningComputer Science인용 수 3
한 줄 요약

이 논문은 확산 모델을 대상으로 하는 새로운 멤버십 인식 공격인 PFAMI를 제안한다. PFAMI는 데이터 기록 주변의 확률적 변동성을 분석하여 기억화(memorization)를 활용함으로써 멤버십 여부를 탐지한다. 기존의 과적합(overfitting)에 의존하는 공격 방식과는 달리, PFAMI는 지역적 확률 변동성의 특징을 활용하여 기존 최고의 베이스라인 대비 27.9% 높은 공격 성공률을 달성한다.

ABSTRACT

Membership Inference Attack (MIA) identifies whether a record exists in a machine learning model's training set by querying the model. MIAs on the classic classification models have been well-studied, and recent works have started to explore how to transplant MIA onto generative models. Our investigation indicates that existing MIAs designed for generative models mainly depend on the overfitting in target models. However, overfitting can be avoided by employing various regularization techniques, whereas existing MIAs demonstrate poor performance in practice. Unlike overfitting, memorization is essential for deep learning models to attain optimal performance, making it a more prevalent phenomenon. Memorization in generative models leads to an increasing trend in the probability distribution of generating records around the member record. Therefore, we propose a Probabilistic Fluctuation Assessing Membership Inference Attack (PFAMI), a black-box MIA that infers memberships by detecting these trends via analyzing the overall probabilistic fluctuations around given records. We conduct extensive experiments across multiple generative models and datasets, which demonstrate PFAMI can improve the attack success rate (ASR) by about 27.9% when compared with the best baseline.

연구 동기 및 목표

  • 기존 멤버십 인식 공격(MIA)가 과적합에 의존하는 한계를 해결하기 위해, 정규화를 통해 과적합을 완화할 수 있어 실제 적용에서의 효과가 떨어지는 문제를 해결하고자 한다.
  • 특히 과적합이 없는 환경에서도 지속적이고 일반화 가능한 신호로 기억화를 활용하여 생성 모델 내 멤버십 인식을 탐색하고자 한다.
  • 거대한 합성 데이터나 화이트박스 접근이 필요 없이 지역적 확률적 변동성을 추정하는 실용적인 MIA 프레임워크를 설계하고자 한다.
  • 다양한 방향과 거리에서의 확률적 변동성을 통합하는 효과적인 추론 함수를 개발하여 멤버와 비멤버 기록을 구분하고자 한다.
  • 다양한 생성 모델과 데이터셋, 특히 확산 모델에서의 강건성과 우수성을 입증하고자 한다.

제안 방법

  • 대규모 합성 데이터에 의존하지 않고도 주어진 기록의 생성 확률을 효율적으로 근사화하는 변동형 추론 기반 확률 추정 방법을 제안한다.
  • 이웃 샘플 간의 생성 확률 변동성을 정량화하는 확률적 변동성 지표 ∆p̂θ를 도입하여, 대상 기록 주변 국소 영역 내에서의 확률 변동성을 측정한다.
  • 다양한 거리와 방향에서 대표적인 이웃 기록을 생성하는 샘플링 전략을 설계하여 고차원 공간 내 다방향 확률적 변동성을 포괄적으로 캡처한다.
  • 다양한 이웃 기록 간의 확률적 변동 패턴을 통합하고 학습하기 위해 신경망 기반의 추론 함수를 활용하여 멤버와 비멤버 간의 구분 능력을 향상시킨다.
  • 모든 구성 요소를 통합하여 블랙박스 환경에서 작동하는 통합 프레임워크 PFAMI를 설계하였으며, 확산 모델 및 VAE와 같은 확률적 생성 모델에 적용 가능하다.
  • 추정된 변동성 지표를 분류 신호로 활용한다: 기억화로 인해 멤버는 정상적인 피크 형태의 양의 변동성을 보이며, 비멤버는 거의 0에 가까운 안정적인 변동성을 나타낸다.

실험 결과

연구 질문

  • RQ1과적합이 없는 생성 모델에서 데이터 기록 주변의 확률적 변동성이 멤버십 인식에 신뢰할 수 있는 신호로 기능할 수 있는가?
  • RQ2거대한 합성 데이터나 화이트박스 접근 없이 지역적 확률적 변동성을 효과적으로 추정하고 측정할 수 있는가?
  • RQ3제안된 변동성 기반 지표가 확산 모델에 대한 기존의 확률 기반 지표보다 얼마나 뛰어나게 성능을 발휘하는가?
  • RQ4제안된 프레임워크의 구성 요소들 — 확률 추정, 이웃 샘플링, 신경 추론 — 가 전체 공격 성능에 얼마나 기여하는가?
  • RQ5제안된 방법이 다양한 생성 모델(예: 확산 모델, VAE)과 데이터셋 간에도 일반화 가능한가?

주요 결과

  • PFAMI는 다양한 확산 모델과 데이터셋에서 기존 최고의 베이스라인 대비 공격 성공률(ASR)을 약 27.9% 향상시켰다.
  • Celeba-64에 대해 훈련된 DDPM 모델에서 ASR 0.947, AUC 0.986을 달성하여 기존 베이스라인을 크게 능가했다.
  • 제거 실험 결과, 변동형 확률 추정, 이웃 샘플링, 신경 추론 각 요소가 성능 향상에 상당한 기여를 함을 확인하였으며, 전체 모델이 가장 높은 ASR를 기록했다.
  • 확률적 변동성 지표 ∆p̂θ는 멤버와 비멤버를 효과적으로 구분한다: 멤버는 기억화로 인해 일관되게 양의 변동성을 보이며, 비멤버는 거의 0에 가까운 안정적인 변동성을 나타낸다.
  • 시각화 결과 멤버와 비멤버 간의 근사 확률 값은 겹치지만, 변동성 지표는 명확히 이를 분리함을 확인하였으며, 특히 확산 모델에서 두드러진 성능을 보였다.
  • 과적합을 정규화를 통해 완화한 환경에서도 본 방법이 효과를 유지하여, 과적합이 없는 실질적 환경에서의 강건성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.