[논문 리뷰] Verifiable and Provably Secure Machine Unlearning
이 논문은 사용자가 모델에서 자신의 데이터가 올바르게 제거되었는지 암호학적으로 검증할 수 있도록 해주는, 검증 가능한 머신 언러닝을 위한 첫 번째 공식적인 암호 기반 프레임워크를 소개한다. SNARKs와 해시 체인을 사용하여 올바른 언러닝 실행을 위한 증명을 생성함으로써, 재학습, 기억상실형, 최적화 기반 언러닝 기법들에 대해 신뢰 없는 검증을 보장하며, 선형 회귀, 로지스틱 회귀, 신경망에 대한 성공적인 구현을 보였다.
Machine unlearning aims to remove points from the training dataset of a machine learning model after training; for example when a user requests their data to be deleted. While many machine unlearning methods have been proposed, none of them enable users to audit the procedure. Furthermore, recent work shows a user is unable to verify if their data was unlearnt from an inspection of the model alone. Rather than reasoning about model parameters, we propose to view verifiable unlearning as a security problem. To this end, we present the first cryptographic definition of verifiable unlearning to formally capture the guarantees of a machine unlearning system. In this framework, the server first computes a proof that the model was trained on a dataset $D$. Given a user data point $d$ requested to be deleted, the server updates the model using an unlearning algorithm. It then provides a proof of the correct execution of unlearning and that $d otin D'$, where $D'$ is the new training dataset. Our framework is generally applicable to different unlearning techniques that we abstract as admissible functions. We instantiate the framework, based on cryptographic assumptions, using SNARKs and hash chains. Finally, we implement the protocol for three different unlearning techniques (retraining-based, amnesiac, and optimization-based) to validate its feasibility for linear regression, logistic regression, and neural networks.
연구 동기 및 목표
- 기존 언러닝 방법에서 사용자가 모델에서 자신의 데이터가 실제로 제거되었는지 확인할 수 없는 심각한 격차를 해결하기 위해.
- 검증 가능한 언러닝을 보안 문제로 체계화하여, 언러닝이 정확히 수행되었음을 보장하는 암호학적 보장을 제공하기 위해.
- 재학습 기반, 기억상실형, 최적화 기반 방법을 포함한 다양한 언러닝 기법에 적용 가능한 일반적인 프레임워크를 설계하기 위해.
- 언러닝 증명이 간결하고 공개적으로 검증 가능하며, 전체 데이터셋이나 모델 파라미터를 드러내지 않도록 보장하기 위해.
- 실제 세계의 머신 러닝 모델, 즉 선형 회귀, 로지스틱 회귀, 신경망에 대한 구현을 통해 실현 가능성을 입증하기 위해.
제안 방법
- 검증 가능한 언러닝을 위한 새로운 암호 보안 정의를 제안하여, 올바른 정확성 증명을 갖춘 학습 및 삭제 작업의 시퀀스로 언러닝을 모델링하기 위해.
- 모델 업데이트와 데이터셋 변경 간의 관계를 정의하는 '허용 가능한 함수'로 언러닝 기법을 추상화하여, 다양한 방법에 대한 일반화를 가능하게 하기 위해.
- SNARKs (간결한 비상호작용 지식 증명)를 사용하여 언러닝 이후 올바른 모델 업데이트를 위한 압축된, 공개적으로 검증 가능한 증명을 생성하기 위해.
- 해시 체인을 활용하여 데이터셋 변경의 암호학적으로 안전하고 점진적인 이력을 유지하여, 데이터 배제를 효율적으로 증명할 수 있도록 하기 위해.
- 서버가 업데이트된 모델이 사용자 데이터 포인트 d를 제외한 데이터셋 D'에서 학습된 것임을 증명하고, 언러닝 과정이 정확히 수행되었음을 보장하는 프로토콜을 설계하기 위해.
- 기본 데이터셋과 모델을 사용하여 재학습, 기억상실형, 최적화 기반 언러닝 세 가지 기법에 대해 프레임워크를 구현하여 실용성 검증하기 위해.
실험 결과
연구 질문
- RQ1검증 가능한 머신 언러닝을 위한 보증을 포괄하는 공식적인 암호 정의를 수립할 수 있는가?
- RQ2서버를 신뢰하지 않고도 사용자가 자신의 데이터가 머신 러닝 모델에서 정확히 제거되었는지 암호학적으로 검증할 수 있는가?
- RQ3이 프레임워크는 근사적이고 재학습 기반 외의 방법을 포함한 다양한 언러닝 기법에 일반화될 수 있는가?
- RQ4감정 데이터 泄露 없이 효율적이고 간결한 언러닝 증명을 가능하게 하는 암호 원리(primitives)는 무엇인가?
- RQ5제안된 프레임워크는 신경망과 로지스틱 회귀와 같은 실제 머신 러닝 모델에 대해 실현 가능한가?
주요 결과
- 논문은 검증 가능한 언러닝에 대한 첫 번째 공식적인 암호 정의를 제시하며, 추출기 기반 보안과 지식 증명 기반의 강력한 보안 모델을 구축한다.
- 허용 가능한 함수로 언러닝 기법을 추상화함으로써, 재학습 기반, 기억상실형, 최적화 기반 언러닝을 모두 지원하여 광범위한 적용 가능성을 확보한다.
- SNARKs와 해시 체인을 성공적으로 활용하여, 전체 데이터셋이나 모델 파라미터를 드러내지 않으면서도 올바른 언러닝 실행을 위한 간결하고 공개적으로 검증 가능한 증명을 생성한다.
- 구현 결과는 선형 회귀, 로지스틱 회귀, 신경망에서의 실현 가능성을 입증하며, 표준 벤치마크에서 증명 생성 및 검증이 실용적임을 보여준다.
- 모델 파rameter 비교에 의존하지 않고도 사용자가 삭제를 검증할 수 있도록 하여, 특정 조건 하에서 모델 파rameter의 불가구별성으로 인한 부족함을 보완한다.
- 증명을 데이터셋 변경의 암호학적으로 안전한 이력에 바인딩하여 재생 공격을 방지하고, 업데이트 간 데이터 일관성을 보장한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.