Skip to main content
QUICK REVIEW

[논문 리뷰] Oblivious Sampling Algorithms for Private Data Analysis

Sajin Sasy, Olga Ohrimenko|arXiv (Cornell University)|2020. 09. 28.
Privacy-Preserving Technologies in Data인용 수 4
한 줄 요약

이 논문은 신뢰할 수 있는 실행 환경(TEE)과 새로운 무관심 샘플링 알고리즘을 활용하여 데이터 분석 중 강력한 차별적 비밀 보장 보장을 확보하는 프라이버시 보장 샘플링 기반 쿼리 프레임워크를 제안한다. 교체 없이 샘플링 및 포아송 샘플링의 메모리 액세스 패턴을 보호하는 변형을 설계함으로써, 샘플링 기반 접근 방식이 샘플링 기반 접근 방식보다 더 낮은 프라이버시 손실을 초래함을 실험적으로 입증하였다. MNIST 및 CIFAR-10에서 동일한 정확도를 유지하면서 최대 5.5배 낮은 프라이버시 예산(ε)을 달성하였다.

ABSTRACT

We study secure and privacy-preserving data analysis based on queries executed on samples from a dataset. Trusted execution environments (TEEs) can be used to protect the content of the data during query computation, while supporting differential-private (DP) queries in TEEs provides record privacy when query output is revealed. Support for sample-based queries is attractive due to \emph{privacy amplification} since not all dataset is used to answer a query but only a small subset. However, extracting data samples with TEEs while proving strong DP guarantees is not trivial as secrecy of sample indices has to be preserved. To this end, we design efficient secure variants of common sampling algorithms. Experimentally we show that accuracy of models trained with shuffling and sampling is the same for differentially private models for MNIST and CIFAR-10, while sampling provides stronger privacy guarantees than shuffling.

연구 동기 및 목표

  • TEEs를 사용할 때 메모리 액세스 패턴이 샘플 인덱스를 泄露할 수 있는 문제를 해결하기 위해 프라이버시를 유지하는 데 목적이 있다.
  • 관찰자조차도 신뢰할 수 없는 TEE 환경에서 샘플링된 데이터 레코드의 인덱스를 숨길 수 있는 보안적인 데이터 무관심 샘플링 알고리즘을 설계하기 위해 목적이 있다.
  • 차별적 비밀 보장 기반 머신러닝에서 샘플링 기반 접근 방식이 샘플링보다 더 강력한 프라이버시 보장을 제공하는지 평가하기 위해 목적이 있다.
  • TEE 호스트와 공모하는 데이터 과학자로부터 데이터를 보호하는 종단 간 프라이버시 보장 쿼리 프레임워크를 제공하기 위해 목적이 있다.

제안 방법

  • 샘플링 시 다시 삽입하지 않는 경우에 대해 메모리 액세스 패턴이 샘플 인덱스를 드러내지 않도록 보장하는 새로운 무관심 샘플링 알고리즘을 설계한다.
  • TEEs에서 배치 샘플링 중 프라이버시를 유지하기 위해 포아송 샘플링의 데이터 무관심 변형을 개발한다.
  • 암호화된 데이터셋에서 차별적 비밀 보장 쿼리를 지원하는 TEE 기반 프레임워크에 샘플링 알고리즘을 통합한다.
  • 코드 및 데이터 무결성을 보장하기 위해 인텔 SGX를 사용하며, 실행 환경의 정확성과 기밀성 검증을 위해 인증 기능을 활용한다.
  • 샘플링 방법을 MNIST 및 CIFAR-10에서 딥러닝 모델 학습에 적용하여, 샘플링 기반 학습과 비교해 정확도와 프라이버시 손실을 평가한다.
  • Rényi 차별적 비밀 보장을 사용하여 총 프라이버시 손실(ε)을 측정하고, 샘플링 방법과 샘플링 간의 프라이버시 손실을 비교한다.

실험 결과

연구 질문

  • RQ1TEEs에서 메모리 액세스 패턴을 통해 샘플 인덱스를 숨길 수 있는 무관심 샘플링 알고리즘을 설계할 수 있는가?
  • RQ2차별적 비밀 보장 기반 머신러닝에서 샘플링 시 다시 삽입하지 않는 경우 또는 포아송 샘플링이 샘플링보다 더 강력한 프라이버시 보장을 제공하는가?
  • RQ3샘플링 방법의 선택이 프라이버시 보장 기반 딥 네트워크 학습에서 모델 정확도와 프라이버시 손실(ε)에 어떤 영향을 미치는가?
  • RQ4안전한 샘플링은 TEE 기반 프레임워크에 효율적으로 통합되어 종단 간 강력한 프라이버시 보장을 제공하는 프라이버시 보장 데이터 분석을 지원할 수 있는가?

주요 결과

  • 제안된 무관심 샘플링 알고리즘은 신뢰할 수 없는 TEE 환경에서도 메모리 액세스 패턴을 통해 샘플 인덱스 泄露를 방지하는 데 성공하였다.
  • 동일한 학습 에포크 수에서 샘플링 시 다시 삽입하지 않는(SWO) 경우, MNIST에서 총 프라이버시 손실 ε = 2.13, CIFAR-10에서 ε = 4.89를 기록하였으며, 이는 샘플링 기반 접근 방식(ε = 9.39)보다 유의미하게 낮았다.
  • 포아송 샘플링은 MNIST에서 ε = 0.82의 총 프라이버시 손실을 기록하여 테스트된 모든 방법 중에서 가장 낮았으며, 동일한 모델 정확도를 유지하였다.
  • SWO 및 포아송 샘플링의 모델 정확도는 샘플링과 거의 동일했다: MNIST에서 97.43% (SWO) 대비 97.5% (샘플링), CIFAR-10에서 79.0% (SWO) 대비 79.6% (샘플링).
  • 결과는 샘플링 기반 학습이 샘플링보다 더 강력한 프라이버시 증폭 효과를 제공함을 확인하였으며, CIFAR-10에서 동일한 정확도를 유지할 경우 최대 5.5배 낮은 ε를 기록하였다.
  • 더 작은 배치 크기는 추가로 프라이버시 손실을 감소시켰으며, 이는 샘플링이 차별적 비밀 보장 학습에서 ε를 최소화하는 데 유리함을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.