Skip to main content
QUICK REVIEW

[논문 리뷰] HUT: Enabling High-UTility, Batched Queries under Differential Privacy Protection for Internet-of-Vehicles

Junyu Liu, Wangkai Jin|arXiv (Cornell University)|2022. 02. 14.
Privacy-Preserving Technologies in Data인용 수 7
한 줄 요약

HUT는 차량인터넷(IoV)를 위한 차별적 개인정보 보호(DP) 메커니즘을 제안하며, 미니멀한 클러스터링과 순서 제약 조건을 융합하여 배치 처리 및 비균형 쿼리 워크로드에서 데이터 유틸리티를 향상시킨다. K-means를 활용해 소값 데이터를 군집화하고 순서 인식 노이즈 주입을 적용함으로써, 최신 기술 대비 정보 손실을 95.69% 감소시키면서도 강력한 수학적 개인정보 보호 보장을 유지한다.

ABSTRACT

The emerging trends of Internet-of-Vehicles (IoV) demand centralized servers to collect/process sensitive data with limited computational resources on a single vehicle. Such centralizations of sensitive data demand practical privacy protections. One widely-applied paradigm, Differential Privacy, can provide strong guarantees over sensitive data by adding noises. However, directly applying DP for IoV incurs significant challenges for data utility and effective protection. We observe that the key issue about DP-enabled protection in IoV lies in how to synergistically combine DP with special characteristics of IoV, whose query sequences are usually formed as unbalanced batches due to frequent interactions between centralized servers and edge vehicles. To this end, we propose HUT, a new algorithm to enable High UTility for DP-enabled protection in IoV. Our key insight is to leverage the inherent characteristics in IoV: the unbalanced batches. Our key idea is to aggregate local batches and apply Order Constraints, so that information loss from DP protection can be mitigated. We evaluate the effectiveness of HUT against the state-of-the-art DP protection mechanisms. The results show that HUT can provide much lower information loss by 95.69\% and simultaneously enable strong mathematically-guaranteed protection over sensitive data.

연구 동기 및 목표

  • 중앙집중식 데이터 처리로 인해 민감한 차량 데이터가 노출되는 IoV 시스템에서 데이터 유틸리티와 개인정보 보호를 균형 있게 유지하는 문제를 해결한다.
  • IoV에서 흔히 발생하는 비균형적이고 빈번한 쿼리 배치를 고려하지 못하는 기존 DP 메커니즘의 한계를 극복한다.
  • 정보 손실을 최소화하면서도 수학적 개인정보 보호 보장을 훼손하지 않는 DP 준수 프레임워크를 개발한다.
  • 특히 IoV 쿼리 워크로드의 내재된 특성인 비균형적 배치를 활용하여, DP 하에서 데이터 유틸리티를 향상시킨다.
  • 간단 쿼리와 카운팅 쿼리 모두에서 최신 기술 대비 뚜렷한 유틸리티 향상을 달성한다.

제안 방법

  • 소값 데이터를 군집화하기 위해 K-means 군집화를 활용한 마이크로-아그리게이션을 적용하여 감도를 감소시키고 신호 대 노이즈 비율(SNR)을 향상시킨다.
  • 소값 데이터(군집화 대상)와 큰 값(군집화되지 않은 값)을 분리하기 위해 동적 임계값을 설정하여 고감도 영역에서의 왜곡을 최소화한다.
  • 클러스터링된 데이터와 비클러스터링된 데이터에 라플라스 노이즈를 추가함으로써 $\epsilon$-차별적 개인정보 보호를 구현하여 수학적 개인정보 보호 보장을 확보한다.
  • DP 보호된 데이터에 순서 제약 조건(OC)을 적용하여 의미적 또는 논리적 순서에 따라 결과를 재정렬함으로써 의미 있는 데이터 구조를 유지한다.
  • 다양한 개인정보 보호 예산($\epsilon$)에서 정보 손실을 최소화하기 위해 군집화 파라미터(k 및 임계값)를 최적화한다.
  • 하이브리드 쿼리 처리 파이프라인을 활용: 마이크로-아그리게이션 → DP 노이즈 주입 → 순서 제약 조건 적용 → 출력

실험 결과

연구 질문

  • RQ1왜곡 노이즈로 인한 과도한 정보 손실을 초래하지 않으면서도, IoV 시스템에 차별적 개인정보 보호를 효과적으로 적용할 수 있는 방법은 무엇인가?
  • RQ2IoV 쿼리 시퀀스의 비균형적이고 배치 처리되는 특성을 활용하여, DP 하에서 데이터 유틸리티를 향상시킬 수 있는가?
  • RQ3마이크로-아그리게이션과 순서 제약 조건이 DP 보호 쿼리에서 정보 손실을 얼마나 줄일 수 있는가?
  • RQ4HUT의 성능은 다양한 개인정보 보호 예산($\epsilon$)과 데이터 분포에서 어떻게 변화하는가?
  • RQ5실제로 정보 손실을 최소화하기 위해 군집화 파라미터(k 및 임계값)의 최적 설정은 무엇인가?

주요 결과

  • 간단 쿼리에서 $\epsilon = 0.05$ 조건 하에서 HUT는 최신 기술 대비 평균 정보 손실을 95.69% 감소시켰다.
  • 카운팅 쿼리에서 HUT는 $\epsilon = 0.008$ 조건에서 최대 64.13%의 정보 손실 감소를 달성했다.
  • 정보 손실을 최소화하기 위한 최적의 군집 수(k)는 5에서 15 사이에 위치하며, 일반적으로 k=10일 때 뛰어난 성능을 보였다.
  • 군집화를 위한 임계값 설정은 영향이 미미하여, 간단 쿼리에서는 최대 1% 이내의 변동을 유발하고, 카운팅 쿼리에서는 최대 6%의 변동을 초래했다.
  • 정보 손실 감소율은 $\epsilon$가 감소할수록 향상되며, 특히 낮은 개인정보 보호 예산에서 가장 높은 성과를 보였다.
  • HUT는 뛰어난 수학적 개인정보 보호 보장을 유지하면서도, 다양한 쿼리 유형에서 기존 방법 대비 뚜렷한 데이터 유틸리티 향상을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.