Skip to main content
QUICK REVIEW

[논문 리뷰] Privacy Preserving Location Data Publishing: A Machine Learning Approach

Sina Shaham, Ming Ding|arXiv (Cornell University)|2019. 02. 24.
Privacy-Preserving Technologies in Data참고 문헌 41인용 수 4
한 줄 요약

이 논문은 공간시간 궤적 데이터셋을 위한 기계학습 기반 익명화(MLA) 프레임워크를 제안한다. 이 프레임워크는 수정된 k′-means 군집화 알고리즘과 점진적 시퀀스 정렬을 활용하여 개인정보 보호를 강화하면서도 데이터 유용성을 유지한다. 기존 방법보다 높은 유용성을 달성하기 위해 군집화와 정렬을 새로운 k-익명성 공식화를 통해 최적화한다.

ABSTRACT

Publishing datasets plays an essential role in open data research and promoting transparency of government agencies. However, such data publication might reveal users' private information. One of the most sensitive sources of data is spatiotemporal trajectory datasets. Unfortunately, merely removing unique identifiers cannot preserve the privacy of users. Adversaries may know parts of the trajectories or be able to link the published dataset to other sources for the purpose of user identification. Therefore, it is crucial to apply privacy preserving techniques before the publication of spatiotemporal trajectory datasets. In this paper, we propose a robust framework for the anonymization of spatiotemporal trajectory datasets termed as machine learning based anonymization (MLA). By introducing a new formulation of the problem, we are able to apply machine learning algorithms for clustering the trajectories and propose to use $k$-means algorithm for this purpose. A variation of $k$-means algorithm is also proposed to preserve the privacy in overly sensitive datasets. Moreover, we improve the alignment process by considering multiple sequence alignment as part of the MLA. The framework and all the proposed algorithms are applied to TDrive and Geolife location datasets. The experimental results indicate a significantly higher utility of datasets by anonymization based on MLA framework.

연구 동기 및 목표

  • 개별 위치를 초월한 공간시간 거리 요소를 고려한 잘 정의된 궤적 군집화 방법의 부재를 해결한다.
  • 기존 연구에서 사용된 쌍별 시퀀스 정렬로 인한 높은 정보 손실 문제를 해결하기 위해 익명화 파이프라인에 다중 시퀀스 정렬을 도입한다.
  • 다양한 익명화 기법을 비교하고 기준화하기 위한 통합 평가 지표를 개발한다.
  • 기계학습과 개인정보 보존 데이터 변환을 융합하여 k-익명 궤적 공개의 데이터 유용성을 향상시킨다.
  • 특정한 변형된 k′-means 알고리즘을 통해 고감도 데이터셋에서 k-익명성을 확보한다.

제안 방법

  • 기계학습 적용을 가능하게 하기 위해 시스템 표현 방식을 변경하여 궤적 익명화를 최적화 문제로 공식화한다.
  • 공간시간 유사성 기반으로 궤적을 군집화하기 위해 k′-means 군집화를 적용하여 익명화 과정에서의 왜곡을 최소화한다.
  • 과도하게 민감한 데이터셋에서 k-익명성을 강제하기 위해 군집 형성 방식을 제어하는 수정된 k′-means 변형을 도입한다.
  • 궤적 일반화 과정에서의 정보 손실을 줄이기 위해 다중 시퀀스 정렬 기법으로서 점진적 시퀀스 정렬(PSA)을 구현한다.
  • 익명화의 사생활 보호와 유용성 간의 상호 최적화를 위해 군집화와 정렬을 통합한 MLA 프레임워크를 구축한다.
  • 실제 TDrive 및 Geolife 데이터셋을 사용하여 실제 조건 하에서 프레임워크를 평가한다.

실험 결과

연구 질문

  • RQ1궤적 군집화를 최적화 문제로 공식화하면 익명화 과정에서 사생활 보호와 유용성 향상에 어떻게 기여할 수 있는가?
  • RQ2궤적 익명화에서 다중 시퀀스 정렬은 쌍별 정렬에 비해 정보 손실을 얼마나 줄이는가?
  • RQ3수정된 k′-means 알고리즘이 민감한 데이터셋에서 데이터 왜곡을 최소화하면서도 효과적으로 k-익명성을 강제할 수 있는가?
  • RQ4MLA 프레임워크는 기존 익명화 기법과 비교해 보안 보장과 유용성 측면에서 어떻게 다른가?
  • RQ5의료 기록 및 웹 분석과 같은 실제 응용 분야에서 MLA 프레임워크는 어떻게 효과적으로 적용될 수 있는가?

주요 결과

  • TDrive 및 Geolife 데이터셋을 대상으로 한 실험 결과, MLA 프레임워크는 기존 k-익명화 방법보다 유의미하게 높은 데이터 유용성을 확보한다.
  • k′-means 군집화 방법은 휘도 기반 군집화 방법보다 유용성과 계산 효율성 측면에서 뛰어나며, 처리 시간과 구현 복잡도가 낮다.
  • 점진적 시퀀스 정렬(PSA)은 쌍별 정렬에 비해 정보 손실을 줄여 익명화된 궤적의 정밀도를 향상시킨다.
  • 제안된 k′-means 변형은 그룹 수준의 구분 불가능성을 유지함으로써 민감한 데이터셋에서 k-익명성을 성공적으로 강제한다.
  • 의료 기록 및 웹 분석과 같은 다양한 분야에 적용 가능하며, 종단 간 또는 추적 기반 데이터가 개인정보 보호를 필요로 하는 경우에 효과적이다.
  • 실험 결과, MLA는 강력한 사생활 보호 보장을 유지하면서도 게시된 데이터셋 내에서 의미 있는 공간시간 패턴을 유지함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.