Skip to main content
QUICK REVIEW

[논문 리뷰] Secure and Utility-Aware Data Collection with Condensed Local Differential Privacy

Mehmet Emre Gürsoy, Acar Tamersoy|arXiv (Cornell University)|2019. 05. 15.
Privacy-Preserving Technologies in Data참고 문헌 44인용 수 15
한 줄 요약

이 논문은 소규모 사용자 인구에서의 유효성을 높이기 위해 유사한 편향된 출력을 선호하는 압축 확률 분포를 사용하는 새로운 프라이버시 보장 프레임워크인 압축 국소 미분 프라이버시(Condensed Local Differential Privacy, CLDP)를 소개한다. 저자는 순서형, 항목형, 순서형 데이터를 위한 Ordinal-CLDP, Item-CLDP, Sequence-CLDP 프로토콜을 제안하며, 특히 소규모 인구 및 순서형 데이터에서 기존 LDP 방법보다 훨씬 높은 정확도를 달성한다. 이와 동시에 순서의 내용과 길이에 대한 프라이버시도 유지한다.

ABSTRACT

Local Differential Privacy (LDP) is popularly used in practice for privacy-preserving data collection. Although existing LDP protocols offer high utility for large user populations (100,000 or more users), they perform poorly in scenarios with small user populations (such as those in the cybersecurity domain) and lack perturbation mechanisms that are effective for both ordinal and non-ordinal item sequences while protecting sequence length and content simultaneously. In this paper, we address the small user population problem by introducing the concept of Condensed Local Differential Privacy (CLDP) as a specialization of LDP, and develop a suite of CLDP protocols that offer desirable statistical utility while preserving privacy. Our protocols support different types of client data, ranging from ordinal data types in finite metric spaces (numeric malware infection statistics), to non-ordinal items (OS versions, transaction categories), and to sequences of ordinal and non-ordinal items. Extensive experiments are conducted on multiple datasets, including datasets that are an order of magnitude smaller than those used in existing approaches, which show that proposed CLDP protocols yield high utility. Furthermore, case studies with Symantec datasets demonstrate that our protocols accurately support key cybersecurity-focused tasks of detecting ransomware outbreaks, identifying targeted and vulnerable OSs, and inspecting suspicious activities on infected machines.

연구 동기 및 목표

  • 사이버보안 맥락에서 흔한 소규모 사용자 인구에서 기존 국소 미분 프라이버시(LDP) 프로토콜의 낮은 유효성 문제를 해결한다.
  • 기존 LDP 체계가 순서형과 비순서형 항목이 혼합된 순서형 데이터의 프라이버시 보장 편향을 지원하지 못하는 한계를 극복한다.
  • 소규모 데이터 수집에서 통계적 유효성을 크게 향상시키면서도 강력한 프라이버시 보장을 유지하는 프라이버시 프레임워크를 개발한다.
  • 사용자 텔레메트리 데이터를 기반으로 랜섬웨어 탐지, OS 취약성 분석, 이상 행동 모니터링 등의 사이버보안 작업에서 정확한 추론을 가능하게 한다.
  • CLDP가 동일한 위협 모델 하에서 표준 LDP와 동일한 프라이버시 보호 수준을 제공함을 보장하기 위해 베이지안 적대자 모델을 정식으로 수립한다.

제안 방법

  • 유사한 출력을 선호하는 압축 확률 분포를 사용하는 LDP의 특수화된 형태인 압축 국소 미분 프라이버시(CLDP)를 도입한다.
  • 프라이버시와 유효성 최적화를 보장하기 위해 핵심 구성 요소로 지수 기반 메커니즘의 변형을 활용한다.
  • 유한 거리 공간 데이터(예: 수치적 악성코드 통계)를 위한 순서형-CLDP, 비순서형 카테고리 데이터(예: OS 버전)를 위한 항목-CLDP, 혼합 데이터 유형의 순서형 시퀀스를 위한 시퀀스-CLDP를 설계한다.
  • 특히 빈도가 높거나 의미적으로 유사한 값에 가중치를 두기 위해 신중하게 설계된 점수 함수를 사용한 지수 기반 메커니즘을 적용한다.
  • 최대 사후 신뢰도 공격에 대비하여 CLDP가 표준 LDP와 동일한 프라이버시 보장을 제공함을 정식으로 입증하기 위해 베이지안 적대자 모델을 사용한다.
  • 실제 Symantec 데이터셋과 공개 벤치마크를 대상으로 프로토콜을 구현하고 평가하였으며, 이는 이전 LDP 연구에서 사용된 데이터셋보다 약 10배 이상 작은 규모의 데이터셋을 포함한다.

실험 결과

연구 질문

  • RQ1사이버보안 응용 분야에서 소규모 사용자 인구(예: 10,000명 미만)에서도 높은 유효성을 유지하는 프라이버시 보장 데이터 수집 프레임워크를 설계할 수 있는가?
  • RQ2국소 미분 프라이버시를 어떻게 확장하여 순서형 데이터의 내용과 길이를 모두 보존하는 프라이버시 보장 편향을 지원할 수 있는가? 특히 순서형과 비순서형 항목이 혼합된 경우에 대해.
  • RQ3낮은 인구 규모 환경에서 표준 LDP 메커니즘에 비해 압축 확률 분포의 사용이 유효성 향상에 얼마나 기여하는가?
  • RQ4CLDP 프로토콜이 랜섬웨어 유포 감지 및 취약성 식별과 같은 핵심 사이버보안 작업에서 정확한 추론을 달성하면서도 사용자 프라이버시를 유지할 수 있는가?
  • RQ5빈도 높은 항목 추정 및 순서 순위 매기기 작업에서, CLDP 프로토콜은 SVIM과 같은 기존 LDP 프로토콜에 비해 유효성 측면에서 얼마나 뛰어나게 성능을 발휘하는가?

주요 결과

  • 같은 프라이버시 예산(ε) 하에서 시퀀스-CLDP는 SVIM 프로토콜 대비 평균 상대 오차(AvRE) 기준 30~90% 높은 정확도를 달성한다. 특히 k 값이 작은 경우에 두드러진다.
  • k > 512일 경우 SVIM의 오차율은 거의 지수적으로 증가하지만, 시퀀스-CLDP는 선형 또는 부분선형 감소를 보이며, 희귀 항목 추정에 있어 훨씬 뛰어난 확장성을 입증한다.
  • k > 128일 경우 시퀀스-CLDP의 켄달-타우 점수는 SVIM을 크게 앞서며, 순서 및 순위 질의의 보존 정도가 뛰어나다는 것을 시사한다.
  • 이전 LDP 연구에서 사용된 데이터셋보다 약 10배 이상 작은 규모의 데이터셋에서도 CLDP 프로토콜이 높은 유효성을 유지하여, 저규모 사이버보안 시나리오에서 정확한 추론을 가능하게 한다.
  • Symantec 데이터셋을 활용한 사례 연구 결과, CLDP 프로토콜이 랜섬웨어 유포 감지, 타겟팅된 OS 및 취약한 OS 식별, 이상 기계 행동 분석과 같은 핵심 보안 작업을 정확하게 지원함을 확인하였다.
  • 베이지안 적대자 모델을 통한 분석 결과, CLDP가 표준 LDP와 동일한 프라이버시 보장을 제공함을 확인하였으며, 적대자가 진짜 값에 대한 최대 사후 신뢰도가 제한되어 있음을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.