Skip to main content
QUICK REVIEW

[논문 리뷰] Differentially Private Stochastic Gradient Descent for in-RDBMS Analytics.

Xi Wu, Arun Kumar|arXiv (Cornell University)|2016. 06. 15.
Privacy-Preserving Technologies in Data참고 문헌 19인용 수 12
한 줄 요약

이 논문은 개인정보 보호를 위해 고정된 수의 학습 반복 후에만 노이즈를 추가함으로써 성능 오버헤드를 최소화하면서도 개인정보 보호를 보장하는, RDBMS 내 분석을 위한 차별적 개인 정보 보호를 고려한 확률적 경사 하강법(SGD) 알고리즘을 제안한다. 이 방법은 포스트그레스(Postgres)에서 기존의 비밀 보장된 SGD 방법들보다 훨씬 높은 테스트 정확도를 달성하며, 원활한 통합과 효율성을 입증한다.

ABSTRACT

In-RDBMS data analysis has received considerable attention in the past decade and has been widely used in sensitive domains to extract patterns in data using machine learning. For these domains, there has also been growing concern about privacy, and differential privacy has emerged as the gold standard for private data analysis. However, while differentially private machine learning and in-RDBMS data analytics have been studied separately, little previous work has explored private learning in an in-RDBMS system. This work considers a specific algorithm --- stochastic gradient descent (SGD) for differentially private machine learning --- and explores how to integrate it into an RDBMS system. We find that previous solutions on differentially private SGD have characteristics that render them unattractive for an RDBMS implementation. To address this, we propose an algorithm that runs SGD for a constant number of passes and then adds noise to the resulting output. We provide a novel analysis of the privacy properties of this algorithm. We then integrate it, along with two existing versions of differentially private SGD, in the Postgres RDBMS. Experimental results demonstrate that our proposed approach can be easily integrated into an RDBMS, incurs virtually no overhead, and yields substantially better test accuracy than the other private SGD algorithm implementations.

연구 동기 및 목표

  • 특히 개인정보 민감도가 높은 분야에서, 차별적 개인 정보 보호 기반 머신 러닝과 RDBMS 내 데이터 분석을 통합하는 데 발생하는 격차를 해소하기 위해.
  • RDBMS 환경에서의 실용적 구현을 방해하는 기존의 차별적 개인 정보 보호 SGD 접근법의 한계를 규명하기 위해.
  • 효율적이고 RDBMS 시스템에 쉽게 통합될 수 있으며, 강력한 개인정보 보호 보장을 유지하는 새로운 비밀 보장된 SGD 알고리즘을 설계하기 위해.
  • 실제 RDBMS(Postgres) 환경에서 개인정보 보호, 정확도, 성능 오버헤드 측면에서 기존의 비밀 보장된 SGD 구현과 비교하여 제안된 방법을 평가하기 위해.

제안 방법

  • 학습 데이터에 대해 일정한 수의 반복 학습을 수행한 후에만 최종 모델 파라미터에 노이즈를 추가하는 새로운 비밀 보장된 SGD 알고리즘을 제안한다.
  • 제안된 알고리즘의 차별적 개인 정보 보호 보장을 공식적으로 입증하기 위해 새로운 개인정보 보호 분석 기법을 활용한다.
  • 직접 성능 비교가 가능하도록, 제안된 알고리즘과 두 가지 기존의 비밀 보장된 SGD 변종을 모두 포스트그레스 RDBMS 내에 구현한다.
  • 기존의 RDBMS 쿼리 처리 및 실행 메커니즘을 활용하여 학습 파이프라인을 지원함으로써, 기반 시스템에 대한 수정을 최소화한다.
  • 기존의 비밀 보장된 SGD에서와 같이 반복마다 노이즈를 추가하는 대신, 학습 후 한 번만 노이즈를 주입함으로써 오버헤드를 줄인다.
  • 기존의 SQL 기반 데이터 워크플로우와의 호환성을 확보하기 위해 학습 과정을 RDBMS 엔진 내부에 통합한다.

실험 결과

연구 질문

  • RQ1차별적 개인 정보 보호를 고려한 SGD 알고리즘이 RDBMS 내 분석에 효율적이고 효과적으로 통합될 수 있는가?
  • RQ2RDBMS 환경에서 제안된 비밀 보장된 SGD 방법은 기존의 비밀 보장된 SGD 접근법과 비교해 정확도와 성능 오버헤드 측면에서 어떻게 다른가?
  • RQ3고정된 수의 학습 반복 후에만 노이즈를 추가하는 비밀 보장된 SGD 변종의 개인정보 보호 보장 수준은 어떠한가?
  • RQ4제안된 방법은 관계형 데이터베이스 환경에서 차별적 개인 정보 보장을 확보하면서도 높은 모델 정확도를 얼마나 유지할 수 있는가?

주요 결과

  • 제안된 비밀 보장된 SGD 방법은 포스트그레스 RDBMS에 통합되면서 거의 모든 성능 오버헤드를 유발하지 않아 실사용에 적합하다.
  • 동일한 RDBMS 환경에서 두 가지 기존의 비밀 보장된 SGD 구현과 비교해 훨씬 높은 테스트 정확도를 달성한다.
  • 새로운 개인정보 보호 분석을 통해 제안된 알고리즘이 강력한 이론적 보장을 바탕으로 차별적 개인 정보 보장을 만족함을 확인한다.
  • 외부 프레임워크나 복잡한 데이터 이동 없이도 RDBMS 내부에서 직접 개인 정보 보호 기반 머신 러닝을 수행할 수 있다.
  • RDBMS 내에 개인 정보 보호 학습을 통합하는 것은 가능하고 효율적이며, 개인정보 보존 학습이 데이터베이스 시스템 내에서 네이티브로 지원될 수 있음을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.