Skip to main content
QUICK REVIEW

[논문 리뷰] Assessing the risk of re-identification arising from an attack on anonymised data

Anna Antoniou, Giacomo Dossena|arXiv (Cornell University)|2022. 03. 31.
Ethics in Clinical Research인용 수 4
한 줄 요약

이 논문은 표적 공격 하에서 k-익명으로 처리된 전자 건강 기록(EHR) 데이터셋의 재식별 위험을 평가하기 위한 분석 프레임워크를 제안한다. 재귀적 확률 모델과 몬테카를로 시뮬레이션을 사용하여, 악성 공격자가 확보한 데이터 비율이 높을수록 재식별 가능성은 증가하고, 등가 클래스 크기가 클수록 감소함을 정량화한다. 이는 원하는 위험 임계값을 기반으로 체계적인 k-익명화 파rameterization을 가능하게 한다.

ABSTRACT

Objective: The use of routinely-acquired medical data for research purposes requires the protection of patient confidentiality via data anonymisation. The objective of this work is to calculate the risk of re-identification arising from a malicious attack to an anonymised dataset, as described below. Methods: We first present an analytical means of estimating the probability of re-identification of a single patient in a k-anonymised dataset of Electronic Health Record (EHR) data. Second, we generalize this solution to obtain the probability of multiple patients being re-identified. We provide synthetic validation via Monte Carlo simulations to illustrate the accuracy of the estimates obtained. Results: The proposed analytical framework for risk estimation provides re-identification probabilities that are in agreement with those provided by simulation in a number of scenarios. Our work is limited by conservative assumptions which inflate the re-identification probability. Discussion: Our estimates show that the re-identification probability increases with the proportion of the dataset maliciously obtained and that it has an inverse relationship with the equivalence class size. Our recursive approach extends the applicability domain to the general case of a multi-patient re-identification attack in an arbitrary k-anonymisation scheme. Conclusion: We prescribe a systematic way to parametrize the k-anonymisation process based on a pre-determined re-identification probability. We observed that the benefits of a reduced re-identification risk that come with increasing k-size may not be worth the reduction in data granularity when one is considering benchmarking the re-identification probability on the size of the portion of the dataset maliciously obtained by the adversary.

연구 동기 및 목표

  • 악성 데이터 유출 사례 하에서 익명화된 의료 데이터셋의 재식별 위험을 정량화하기 위해.
  • k-익명으로 처리된 EHR 데이터셋에서 한 명의 환자에 대한 재식별 확률을 추정하는 분석 방법을 개발하기 위해.
  • 단일 환자 모델을 일반화하여 동시에 여러 환자를 재식별할 위험을 추정하기 위해.
  • 다양한 공격 시나리오에서 분석적 추정치의 정확성을 몬테카를로 시뮬레이션을 통해 검증하기 위해.
  • 사전 정의된 재식별 위험 기준치를 바탕으로 체계적인 k-익명화 파라미터 선택을 안내하기 위해.

제안 방법

  • 조합 확률를 활용하여 k-익명 데이터셋에서 한 명의 환자에 대한 재식별 확률에 대한 분석적 표현을 유도한다.
  • 단일 환자 모델을 재귀적 공식으로 일반화하여 임의의 k-익명화 체계에서 다수의 환자를 동시에 재식별할 확률을 계산한다.
  • 합성 EHR 데이터셋을 대상으로 몬테카를로 시뮬레이션을 수행하여 다양한 공격 시나리오에서 분석적 위험 추정치의 정확성을 검증한다.
  • 악성 공격자가 확보한 데이터 비율과 등가 클래스 크기와 같은 핵심 변수들이 재식별 위험에 미치는 영향을 평가한다.
  • 재식별 확률의 상한선 추정을 보장하기 위해 모델에 보수적인 가정을 적용하여 위험 평가의 안전성을 향상시킨다.
  • 목표 재식별 위험 수준을 기반으로 k-익명화 파arameter를 체계적으로 설정하는 방법을 제안한다.

실험 결과

연구 질문

  • RQ1표적 공격 하에서 k-익명으로 처리된 EHR 데이터셋에서 한 명의 환자에 대한 분석적 재식별 확률은 무엇인가?
  • RQ2여러 환자를 동시에 표적으로 삼을 경우 재식별 확률은 어떻게 변화하는가?
  • RQ3다양한 공격 조건에서 분석적 위험 추정치와 실증적 시뮬레이션 결과 간의 정확도는 어떻게 비교되는가?
  • RQ4악성 공격자가 확보한 데이터 비율이 k-익명 데이터셋의 재식별 위험에 어떤 영향을 미치는가?
  • RQ5재식별 위험을 줄이기 위해 k를 증가시키는 것과 데이터 유용성의 손실 사이의 상충 관계는 어떠한가?

주요 결과

  • 다양한 테스트 시나리오에서 분석 모델의 재식별 확률 추정치가 몬테카를로 시뮬레이션 결과와 매우 유사하게 일치한다.
  • 악성 공격자가 확보한 데이터 비율이 높을수록 재식별 위험이 크게 증가한다.
  • k-익명화에서 재식별 위험과 등가 클래스 크기 사이에는 역관계가 존재한다.
  • 재귀적 공식화는 임의의 k-익명화 체계에서 다수의 환자에 대한 재식별 공격을 다룰 수 있도록 모델을 성공적으로 확장한다.
  • 부분적 데이터 유출 상황을 고려할 경우, k를 증가시켜 재식별 위험을 줄이는 이점이 데이터의 세분성 손실에 의해 상쇄될 수 있다.
  • 제안된 프레임워크는 사전에 정의된 수용 가능한 위험 기준치를 기반으로 k-익명화 파라미터의 체계적 설정을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.