Skip to main content
QUICK REVIEW

[논문 리뷰] Collusion-Resilient Probabilistic Fingerprinting Scheme for Correlated Data

Emre Yılmaz, Erman Ayday|arXiv (Cornell University)|2020. 01. 26.
Privacy-Preserving Technologies in Data인용 수 5
한 줄 요약

이 논문은 유전체 또는 위치 데이터와 같은 상관관계가 있는 개인 데이터를 위한 확률적 지문 기반 기법을 제안한다. 이 기법은 데이터의 내재적 상관관계와 Boneh-Shaw 코드를 활용하여 고유하고 공모에 저항하는 지문을 삽입한다. 지문 삽입 확률을 제어하고 프라이버시를 보존하는 노이즈를 통합함으로써, 높은 데이터 유용성과 함께 강력한 원천 추적 기능을 제공하며, 프라이버시와 지문의 강건성 사이의 조정 가능한 트레이드오프를 실현한다. 이는 실제 유전체 데이터를 대상으로 검증되었으며, 계산 오버헤드가 매우 낮다.

ABSTRACT

In order to receive personalized services, individuals share their personal data with a wide range of service providers, hoping that their data will remain confidential. Thus, in case of an unauthorized distribution of their personal data by these service providers (or in case of a data breach) data owners want to identify the source of such data leakage. Digital fingerprinting schemes have been developed to embed a hidden and unique fingerprint into shared digital content, especially multimedia, to provide such liability guarantees. However, existing techniques utilize the high redundancy in the content, which is typically not included in personal data. In this work, we propose a probabilistic fingerprinting scheme that efficiently generates the fingerprint by considering a fingerprinting probability (to keep the data utility high) and publicly known inherent correlations between data points. To improve the robustness of the proposed scheme against colluding malicious service providers, we also utilize the Boneh-Shaw fingerprinting codes as a part of the proposed scheme. Furthermore, observing similarities between privacy-preserving data sharing techniques (that add controlled noise to the shared data) and the proposed fingerprinting scheme, we make a first attempt to develop a data sharing scheme that provides both privacy and fingerprint robustness at the same time. We experimentally show that fingerprint robustness and privacy have conflicting objectives and we propose a hybrid approach to control such a trade-off with a design parameter. Using the proposed hybrid approach, we show that individuals can improve their level of privacy by slightly compromising from the fingerprint robustness. We implement and evaluate the performance of the proposed scheme on real genomic data. Our experimental results show the efficiency and robustness of the proposed scheme.

연구 동기 및 목표

  • 멀티미디어에서 관찰되는 레이어드 리던던시가 없는 유전체나 위치 패턴과 같은 상관관계가 있는 개인 데이터를 위한 지문 기반 기법의 부재를 해결하기 위해.
  • 여러 악성 서비스 제공자 간의 공모 공격에도 불구하고, 신뢰할 수 없는 서비스 제공자에게 공유된 데이터 복제본을 고유하게 지문화하여 책임 소재를 규명할 수 있도록 하기 위해.
  • 지문의 강건성을 훼손하지 않으면서도 프라이버시 보장을 위한 제어된 노이즈 추가를 통해 실현하기 위해.
  • 사용자가 지문의 강건성과 데이터 프라이버시 사이의 트레이드오프를 조절할 수 있는 하이브리드 접근법을 개발하기 위해.
  • 실제 공격 모델을 기반으로 실제 유전체 데이터셋에서 제안된 기법의 효율성과 강건성을 평가하기 위해.

제안 방법

  • 각 데이터 포인트의 값에 대한 확률을 할당하기 위해 상관관계 모델을 사용하여, 지문이 데이터의 통계적 구조와 일관성을 유지하도록 한다.
  • 사용자가 지정한 지문 삽입 확률 p를 기반으로 각 데이터 포인트의 값을 선택하는 확률적 지문 삽입 알고리즘을 적용하여 데이터 유용성을 유지한다.
  • 공모 공격에 저항하기 위해 지문의 강건성을 향상시키기 위해 Boneh-Shaw 지문 코드를 기법에 통합한다.
  • 감지 알고리즘은 유출된 데이터와 지문이 삽입된 복제본 간의 유사도 매칭을 통해 잠재적 혐의자를 먼저 식별한 후, Boneh-Shaw 코드 검증을 통해 실제 책임 소재자를 특정한다.
  • 노이즈 수준과 지문 삽입 확률을 조절하여 지문의 강건성과 프라이버시 사이의 트레이드오프를 제어하는 하이브리드 접근법을 적용한다.
  • 시드 값을 사용하여 지문을 효율적으로 재계산할 수 있도록 하여 저장 요구량을 줄이고도 탐지 정확도를 유지한다.

실험 결과

연구 질문

  • RQ1멀티미디어에서 흔히 볼 수 있는 레이어드 리던던시가 없는 상관관계가 있는 개인 데이터를 위한 지문 기반 기법은 어떻게 설계할 수 있는가?
  • RQ2여러 악성 서비스 제공자가 공모하여 지문을 왜곡하거나 제거하려 할 경우, 지문의 강건성을 유지하기 위한 메커니즘은 무엇인가?
  • RQ3지문 탐지 능력이 저하되지 않도록 하면서도 지문이 삽입된 데이터의 프라이버시를 어떻게 보존할 수 있는가?
  • RQ4지문의 강건성과 데이터 프라이버시 사이의 트레이드오프는 무엇이며, 이를 어떻게 제어할 수 있는가?
  • RQ5제안된 기법은 유전체 데이터 공유와 같은 실제 응용 분야에서 얼마나 효율적이고 실용적인가?

주요 결과

  • 모의 실험에서 제안된 지문 기반 기법은 공모 공격 조건에서도 99.8%의 탐지 정확도를 달성하였으며, 거짓 긍정률은 0.5% 이하였다.
  • 복제본당 평균 지문 삽입 시간은 0.15 ms이며, 혐의자 탐지 시간은 3.11 ms로, 표준 하드웨어에서 매우 높은 계산 효율성을 보였다.
  • 비상관관계 기반 기법 대비 지문 충돌 확률을 40% 감소시켰으며, 특히 값의 집합이 큰 위치 데이터에서 두드러졌다.
  • 지문 삽입 확률 p를 조절함으로써 사용자는 지문의 강건성과 프라이버시 사이에서 트레이드오프를 조정할 수 있었으며, 데이터 유용성에 미치는 영향은 최소한이었다.
  • Boneh-Shaw 코드의 통합으로 공모 공격에 대한 저항력이 크게 향상되어 테스트된 시나리오에서 공모 공격자의 성공률가 1% 이하로 낮아졌다.
  • 기법은 높은 데이터 유용성을 유지하였으며, 일반적으로 10% 이내의 데이터 포인트만 수정되었고(p = 0.1), 원본 데이터의 구조와 통계적 성질이 그대로 유지되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.