[논문 리뷰] Privacy Side Channels in Machine Learning Systems
이 논문은 기계학습 시스템 내의 프라이버시 사이드 채널을 소개한다—데이터 필터링, 전처리, 출력 필터링, 쿼리 필터링과 같은 시스템 수준의 구성 요소를 악용하여 단일 모델보다 훨씬 높은 속도로 비공개 정보를 추출하는 공격이다. 핵심 발견은 데이터 중복 제거 및 기억 필터와 같은 프라이버시를 향상시키기 위해 설계된 구성 요소가 오히려 차별적 프라이버시 보장을 위반하고 정확한 비밀 키 복원을 가능하게 하는 사이드 채널을 생성할 수 있다는 것이다.
Most current approaches for protecting privacy in machine learning (ML) assume that models exist in a vacuum. Yet, in reality, these models are part of larger systems that include components for training data filtering, output monitoring, and more. In this work, we introduce privacy side channels: attacks that exploit these system-level components to extract private information at far higher rates than is otherwise possible for standalone models. We propose four categories of side channels that span the entire ML lifecycle (training data filtering, input preprocessing, output post-processing, and query filtering) and allow for enhanced membership inference, data extraction, and even novel threats such as extraction of users' test queries. For example, we show that deduplicating training data before applying differentially-private training creates a side-channel that completely invalidates any provable privacy guarantees. We further show that systems which block language models from regenerating training data can be exploited to exfiltrate private keys contained in the training set--even if the model did not memorize these keys. Taken together, our results demonstrate the need for a holistic, end-to-end privacy analysis of machine learning systems.
연구 동기 및 목표
- 기계학습 파이프라인의 시스템 수준 구성 요소가 어떻게 의도치 않게 프라이버시 사이드 채널을 생성하는지 조사하기 위해.
- 데이터 중복 제거 및 기억 필터와 같은 프라이버시를 향상시키기 위한 구성 요소가 오히려 프라이버시 보장을 약화시킬 수 있음을 입증하기 위해.
- 적응형 공격자가 이러한 사이드 채널을 악용해 향상된 소속성 인식 공격 또는 비공개 테스트 쿼리 추출을 수행할 수 있음을 보여주기 위해.
- 고립된 모델의 프라이버시 분석의 한계를 부각하고 종단 간 시스템 수준의 프라이버시 평가를 촉구하기 위해.
- 특히 DP와 중복 제거 방어를 조합할 경우, 보안과 프라이버시 간의 갈등을 드러내기 위해.
제안 방법
- 훈련 데이터 필터링, 입력 전처리, 모델 출력 필터링, 쿼리 필터링의 네 가지 유형의 프라이버시 사이드 채널을 제안하기 위해.
- 시스템 구성 요소가 유도하는 종속성을 악용하기 위해 블랙박스 또는 화이트박스 액세스를 가진 적응형 공격자를 사용하기 위해.
- 데이터 중복 제거가 사용자 데이터를 중복 탐지로 연결함으로써 사이드 채널을 생성하여, 차별적 프라이버시 조건에도 불구하고 프라이버시 위반이 가능하다는 것을 입증하기 위해.
- 언어 모델의 기억 필터를 악용하여 훈련 세트의 세부 정보를 역공학하고, 훈련 데이터에서 비밀 키를 정확히 복원하기 위해.
- 사용자 간에 입력을 집계하는 상태 기반 쿼리 필터를 활용하여 다른 사용자의 비공개 테스트 쿼리를 드러내는 사이드 채널을 생성하기 위해.
- 실제 시스템, 특히 GitHub Copilot과 공개 LLM을 대상으로 한 실험적 평가를 수행하여 사이드 채널 공격의 타당성을 검증하기 위해.
실험 결과
연구 질문
- RQ1데이터 중복 제거 또는 출력 필터와 같은 시스템 수준의 구성 요소가 공식적인 프라이버시 보장을 위반하는 사이드 채널을 어떻게 생성할 수 있는가?
- RQ2적응형 공격자가 시스템 구성 요소에 블랙박스 액세스를 통해 얼마나 많은 비공개 훈련 데이터나 테스트 쿼리를 추출할 수 있는가?
- RQ3왜 데이터 중복 제거를 차별적 프라이버시 훈련과 조합하면 DP만 사용할 때보다 프라이버시가 악화되는가?
- RQ4기본 훈련 데이터 출력을 차단하기 위해 설계된 출력 필터가 오히려 근접한 완벽한 소속성 인식 공격을 가능하게 하여 프라이버시를 감소시킬 수 있는가?
- RQ5사용자 입력을 세션 간 집계하는 상태 기반 쿼리 필터가 어떻게 다른 사용자의 비공개 쿼리를 泄露하는 사이드 채널을 생성하는가?
주요 결과
- 프라이버시 향상을 목적으로 한 데이터 중복 제거가 조건부로 차별적 프라이버시 보장을 완전히 무효화하는 사이드 채널을 생성하며, 이는 DP 훈련 이후 적용된 경우에도 마찬가지다.
- 언어 모델의 기억 필터는 모델이 이를 기억하지 않았더라도 훈련 세트에서 정확한 비밀 키를 복원하는 데 악용될 수 있다.
- 기본 훈련 데이터 출력을 차단하기 위해 설계된 출력 필터는 근접한 완벽한 소속성 인식 공격을 수행하는 데 사용될 수 있다.
- 사용자 입력을 세션 간 집계하는 상태 기반 쿼리 필터는 고립된 모델에서는 불가능한 다른 사용자의 비공개 테스트 쿼리를 泄露하는 사이드 채널을 생성한다.
- 데이터 중복 제거를 차별적 프라이버시 훈련과 조합하면 DP만 사용할 때보다 훨씬 악화된 프라이버시가 발생하며, 이는 프라이버시 메커니즘의 비합성성(composability)을 입증한다.
- GitHub Copilot의 훈련 세트에 대한 공격는 출력 필터링을 악용하여 정확한 훈련 데이터 마감 일자를 드러내었으며, 이는 실제 적용 가능성의 증거가 된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.