Skip to main content
QUICK REVIEW

[논문 리뷰] Privacy-Preserving Distributed Learning in the Analog Domain

Mahdi Soleymani, Hessam Mahdavifar|arXiv (Cornell University)|2020. 07. 17.
Cryptography and Data Security인용 수 11
한 줄 요약

이 논문은 실수 및 복소수 데이터를 위한 기존의 양자화 오차를 피하기 위해 양자화에 의해 발생하는 정확도 손실을 방지하기 위해 샤미어의 비밀 분할 기법의 아날로그 대응체를 사용하는 새로운 프라이버시 보장 분산 학습 프레임워크를 제안한다. 이는 연속 영역에서 구별 보안과 상호정보 보안 간의 이론적 연관성을 수립하고, 부동소수점 구현을 통해 고정점 유한체 방법에 비해 MNIST에서 더 뛰어난 정확도와 효율성을 보여준다.

ABSTRACT

We consider the critical problem of distributed learning over data while keeping it private from the computational servers. The state-of-the-art approaches to this problem rely on quantizing the data into a finite field, so that the cryptographic approaches for secure multiparty computing can then be employed. These approaches, however, can result in substantial accuracy losses due to fixed-point representation of the data and computation overflows. To address these critical issues, we propose a novel algorithm to solve the problem when data is in the analog domain, e.g., the field of real/complex numbers. We characterize the privacy of the data from both information-theoretic and cryptographic perspectives, while establishing a connection between the two notions in the analog domain. More specifically, the well-known connection between the distinguishing security (DS) and the mutual information security (MIS) metrics is extended from the discrete domain to the continues domain. This is then utilized to bound the amount of information about the data leaked to the servers in our protocol, in terms of the DS metric, using well-known results on the capacity of single-input multiple-output (SIMO) channel with correlated noise. It is shown how the proposed framework can be adopted to do computation tasks when data is represented using floating-point numbers. We then show that this leads to a fundamental trade-off between the privacy level of data and accuracy of the result. As an application, we also show how to train a machine learning model while keeping the data as well as the trained model private. Then numerical results are shown for experiments on the MNIST dataset. Furthermore, experimental advantages are shown comparing to fixed-point implementations over finite fields.

연구 동기 및 목표

  • 데이터가 자연스럽게 실수/복소수(아날로그) 형태로 존재하는 분산 학습 시스템에서 데이터 프라이버시를 보존하는 데 있어 핵심 과제를 해결하기 위해.
  • 암호 보안을 위해 실수형 데이터를 유한체로 변환함으로써 발생하는 정확도 저하 문제를 극복하기 위해.
  • 비밀 분할 원리를 이용해 아날로그 데이터에 대한 분산 계산을 위한 안전하고 정보 이론적으로 기반한 프레임워크를 개발하기 위해.
  • 정보 이론적 및 암호학적 지표를 모두 사용하여 아날로그 도메인에서의 프라이버시 보장을 특성화하기 위해.
  • 실세계 학습 작업에서 고정점 대비 부동소수점 구현의 실현 가능성과 이점을 입증하기 위해.

제안 방법

  • 유한체 위에서의 샤미어의 비밀 분할에 대한 연속적 대응체로 아날로그 도메인 비밀 분할 기법을 도입한다.
  • 단일 입력 다중 출력(SIMO) 채널에서의 상관된 노이즈를 사용하여 정보 泄露를 제한하고, 구별 보안(DS)의 관점에서 프라이버시를 확립한다.
  • 이미 알려진 이산 영역에서의 구별 보안(DS)과 상호정보 보안(MIS) 간의 관계를 이산 영역에서 연속 영역으로 확장한다.
  • 수치 정밀도를 유지하고 고정점 기반 기법에서 흔히 발생하는 오버플로우 문제를 방지하기 위해 부동소수점 산술을 사용한다.
  • 데이터가 아날로그 공유로 인코딩되고 병렬로 처리되며, 개별 공유가 드러나지 않는 방식으로 최종 결과가 재구성되는 분산 학습 프로토콜을 설계한다.
  • 특히 MNIST에서 로지스틱 회귀를 사용하여 기계 학습 모델을 훈련시키는 데에 이 프레임워크를 적응시키며, 데이터 및 모델 프라이버시를 모두 보존한다.

실험 결과

연구 질문

  • RQ1실수/복소수(아날로그) 수에 대해 비밀 분할 기반의 안전한 프로토콜을 설계할 수 있는가? 이는 분산 학습에서 데이터 프라이버시를 보존하는 데에 기여할 수 있는가?
  • RQ2연속 영역에서 구별 보안(DS)과 상호정보 보안(MIS)과 같은 프라이버시 메트릭을 어떻게 의미 있게 확장하고 상호 관련성을 정의할 수 있는가?
  • RQ3아날로그 도메인 분산 학습에서 프라이버시 수준과 계산 정확도 사이의 근본적인 상충 관계는 무엇인가?
  • RQ4정확도와 효율성 측면에서 부동소수점 구현 방식이 고정점 유한체 기반 방법에 비해 어떻게 성능을 냅니다?
  • RQ5제안된 프로토콜은 데이터나 모델 프라이버시를 훼손하지 않고 기계 학습 모델을 효과적으로 훈련시키는 데에 적용될 수 있는가?

주요 결과

  • 제안된 아날로그 비밀 분할 기법은 연속 영역에서 정보 이론적 프라이버시 보장을 달성하며, SIMO 채널 용량 결과를 통해 유출된 정보가 제한됨을 보여준다.
  • 논문은 아날로그 도메인에서 구별 보안(DS)과 상호정보 보안(MIS) 간의 이론적 동치성을 수립하였으며, 이는 이전에 알려진 이산 영역 결과를 연장한 것이다.
  • 프로토콜의 부동소수점 구현은 높은 정확도를 유지하며, MNIST 로지스틱 회귀 예측 결과가 중심화된 기준값과 매우 유사하게 나타난다.
  • 고정점 유한체 기반의 대안에 비해 정확도와 런타임 측면에서 모두 뛰어나며, 특히 데이터셋 크기가 증가함에 따라 오버플로우 및 래핑 오류를 피할 수 있기 때문이다.
  • 코딩된 계산의 통신 효율성을 유지하며, MPC 기반 접근 방식에서 나타나는 파티 간 통신 오버헤드를 피한다.
  • 이 방법은 데이터셋 크기가 증가함에 따라 뛰어난 내성적 특성을 보이며, 대규모 훈련에서도 정확도 손실이 거의 없이 유지된다. 반면 고정점 대안은 오버플로우로 인한 정확도 저하를 겪는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.