Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Suppression to Reduce Disclosure Risk and Enhance Data Utility

Marmar Orooji, Gerald M. Knapp|arXiv (Cornell University)|2019. 01. 02.
Privacy-Preserving Technologies in Data참고 문헌 14인용 수 12
한 줄 요약

이 논문은 민감한 데이터셋에서 위험도가 가장 높은 기록들만 선택적으로 억제함으로써 유출 위험을 줄이고 데이터 유용성을 향상시키는 개선된 억제 방법을 제안한다. 실제 데이터셋을 대상으로 한 실험 결과, 기존의 억제 기법에 비해 더 나은 프라이버시-유용성 트레이드오프를 달성함을 확인하였다.

ABSTRACT

In Privacy Preserving Data Publishing, various privacy models have been developed for employing anonymization operations on sensitive individual level datasets, in order to publish the data for public access while preserving the privacy of individuals in the dataset. However, there is always a trade-off between preserving privacy and data utility; the more changes we make on the confidential dataset to reduce disclosure risk, the more information the data loses and the less data utility it preserves. The optimum privacy technique is the one that results in a dataset with minimum disclosure risk and maximum data utility. In this paper, we propose an improved suppression method, which reduces the disclosure risk and enhances the data utility by targeting the highest risk records and keeping other records intact. We have shown the effectiveness of our approach through an experiment on a real-world confidential dataset.

연구 동기 및 목표

  • 익명화된 데이터 공개에서 데이터 프라이버시와 유용성 간의 본질적 트레이드오프를 해결하기 위해.
  • 공개된 데이터셋의 전체 유용성을 훼손하지 않으면서도 유출 위험을 줄이기 위해.
  • 가장 민감한 기록들만 선택적으로 타겟팅하는 억제 전략을 개발하여 데이터 손실를 최소화하기 위해.
  • 기존의 억제 기법을 개선하기 위해 위험도가 높은 기록들에 집중하면서도 저위험 데이터의 무결성을 유지하는 데 목적이 있다.

제안 방법

  • 제안된 방법은 위험 평가 모델에 기반하여 위험도가 가장 높은 기록들만 식별하고 억제한다.
  • 재식별 가능성이 가장 높은 기록들을 우선순위 정렬하기 위해 위험도 스코어링 메커니즘을 사용한다.
  • 모든 다른 기록들이 그대로 유지되도록 하여 데이터 유용성을 보존하기 위해 고위험 기록들만 선택적으로 억제한다.
  • 대상 지정 억제의 효과를 평가하기 위해 실제 기밀 데이터셋을 활용한다.
  • 위험 감소와 유용성 보존 측면에서 제안된 방법을 기준 억제 기법과 비교한다.
  • 표준 프라이버시 및 유용성 메트릭을 사용하여 성능을 평가하였으며, 양쪽 모두에서 향상된 성능을 입증하였다.

실험 결과

연구 질문

  • RQ1어떻게 하면 데이터 유용성 손실를 최소화하면서도 효과적으로 유출 위험을 줄일 수 있는가?
  • RQ2위험도가 가장 높은 기록들만 선택적으로 억제할 경우 전체 데이터 유용성에 어떤 영향을 미치는가?
  • RQ3대상 지정 억제 전략이 균일한 억제 기법에 비해 프라이버시-유용성 트레이드오프 측면에서 뛰어나게 작용할 수 있는가?
  • RQ4기본 기법 대비 제안된 방법은 실제 기밀 데이터셋에서 어떻게 성능을 발휘하는가?
  • RQ5위험도 스코어링과 데이터 유용성 보존 효과 사이의 관계는 어떠한가?

주요 결과

  • 제안된 억제 방법은 가장 취약한 기록들에 집중함으로써 유출 위험을 크게 감소시켰다.
  • 대부분의 기록들이 그대로 유지되므로 전통적인 억제 기법보다 데이터 유용성이 더 효과적으로 보존되었다.
  • 기존의 억제 접근 방식에 비해 프라이버시와 유용성 간의 균형을 더 잘 달성하였다.
  • 실제 데이터셋을 대상으로 한 실험 결과, 과도한 데이터 손실 없이 위험 감소를 위한 대상 지정 억제의 효과성을 확인하였다.
  • 위험도 평가 모델은 고위험 기록을 성공적으로 식별하여 데이터 품질에 미치는 영향를 최소화한 정밀한 억제를 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.