Skip to main content
QUICK REVIEW

[논문 리뷰] Partially Synthetic Data for Recommender Systems: Prediction Performance and Preference Hiding

Manel Slokom, Martha A. Larson|arXiv (Cornell University)|2020. 08. 09.
Privacy-Preserving Technologies in Data참고 문헌 24인용 수 7
한 줄 요약

이 논문은 추천 시스템을 위한 부분적으로 합성된 데이터 생성 방법을 제안하며, 특정 사용자 선호 속성(예: 좋아하는 감독, 배우, 저자)을 숨기면서도 알고리즘 성능의 상대적 순위를 유지한다. CART 기반 보간을 사용한 이 방법은 유티리티를 훼손하지 않으면서도 속성 유출을 64–77% 감소시킨다.

ABSTRACT

This paper demonstrates the potential of statistical disclosure control for protecting the data used to train recommender systems. Specifically, we use a synthetic data generation approach to hide specific information in the user-item matrix. We apply a transformation to the original data that changes some values, but leaves others the same. The result is a partially synthetic data set that can be used for recommendation but contains less specific information about individual user preferences. Synthetic data has the potential to be useful for companies, who are interested in releasing data to allow outside parties to develop new recommender algorithms, i.e., in the case of a recommender system challenge, and also reducing the risks associated with data misappropriation. Our experiments run a set of recommender system algorithms on our partially synthetic data sets as well as on the original data. The results show that the relative performance of the algorithms on the partially synthetic data reflects the relative performance on the original data. Further analysis demonstrates that properties of the original data are preserved under synthesis, but that for certain examples of attributes accessible in the original data are hidden in the synthesized data.

연구 동기 및 목표

  • 최근 페이스북의 사례처럼 고조도의 데이터 오용 사례 이후 증가하는 추천 시스템 연구 분야의 개인정보 우려를 해결하기 위해.
  • 데이터 왜곡이 있음에도 불구하고 합성 데이터가 추천 알고리즘의 상대적 성능 순위를 유지할 수 있는지 탐색하기 위해.
  • 특정 사용자 선호 속성(예: 좋아하는 감독 또는 저자)이 합성 데이터에서 효과적으로 숨겨질 수 있는지, 추천 유티리티를 훼손하지 않도록 평가하기 위해.
  • 부분적 합성 데이터가 알고리즘 벤치마킹 및 과제에 실질적인 대안이 될 수 있음을 입증하는 개념적 증명을 제공하기 위해.
  • 임의의 방법이나 익명화 기반 접근 방식을 넘어서 위협 모델 기반의 체계적인 추천 시스템 개인정보 보호 접근 방식을 수립하기 위해.

제안 방법

  • 이 방법은 사용자-아이템 행렬의 일부 값을 보간함으로써 CART(분류 및 회귀 트리)를 사용해 부분적 합성 데이터를 생성한다. 이 과정에서 일부 원본 항목을 유지한다.
  • 합성 데이터는 사용자 및 아이템 특성 기반으로 원본 평점의 일부를 보간된 값으로 대체하여 생성되며, 원본 데이터와 유사한 구조적 특성을 유지한다.
  • 선호 속성(예: 좋아하는 감독, 배우, 또는 저자)은 높은 평점(≥4)을 받은 아이템에서 유도되며, 원본 데이터와 합성 데이터 간의 비교를 통해 정보 유출 위험을 평가한다.
  • 이 방법은 평점을 순서형 데이터로 간주하며, 미평가된 아이템에 대한 평점을 생성하지 않으며, 기존 평점을 왜곡하여 민감한 속성을 은폐하는 데 집중한다.
  • 성능은 알고리즘 순위 일致성과 속성 유출 비율을 측정하여 MovieLens 및 Goodbooks 데이터셋에서 평가된다.
  • 유출 통제는 원본과 합성 데이터에서 각 사용자의 좋아하는 속성이 다를 확률을 계산하여 평가된다.

실험 결과

연구 질문

  • RQ1부분적 합성 데이터가 원본 데이터와 비교해 추천 시스템 알고리즘의 상대적 성능 순위를 유지할 수 있는가?
  • RQ2특정 사용자 선호 속성(예: 좋아하는 감독 또는 저자)이 추천 유티리티를 떨어뜨리지 않으면서 합성 데이터에서 얼마나 효과적으로 숨겨질 수 있는가?
  • RQ3원본 데이터와 합성 데이터 간의 개별 평점은 얼마나 변화하며, 이는 학습 및 테스트를 위한 전체 데이터 유티리티에 영향을 미치는가?
  • RQ4공개 추천 시스템 과제에 대해 합성 데이터를 개인정보 보호 기반 대안으로 사용하는 것이 가능한가?
  • RQ5제안된 방법이 협업 필터링 시스템에서 사용자 선호를 보호하기 위해 익명화나 차별적 프라이버시보다 실질적인 대안을 제공할 수 있는가?

주요 결과

  • 부분적 합성 데이터에서 추천 알고리즘의 상대적 성능 순위가 원본 데이터의 순위와 매우 유사하게 유지되어 강력한 예측 타당성을 보였다.
  • 64%의 사용자가 원본 데이터와 합성 데이터에서 다른 좋아하는 감독를 가졌으며, 이는 이 속성에 대한 상당한 정보 유출 통제를 의미한다.
  • 77%의 사용자가 원본과 합성 데이터에서 다른 좋아하는 배우를 가졌으며, 이는 배우 선호 정보의 효과적인 은폐를 보여준다.
  • Goodbooks 데이터셋에서 72%의 사용자가 다른 좋아하는 저자를 가졌으며, 이는 저자 선호 정보가 효과적으로 은폐되었음을 확인한다.
  • 원본과 합성 데이터 간 평균 절대 평점 변화는 MovieLens에서 0.825, Goodbooks에서 1.034였으며, 개인 수준에서 상당한 왜곡이 일어났음을 시사한다.
  • 매우 큰 평점 변화에도 불구하고 합성 데이터는 충분한 구조적 및 예측적 특성을 유지하여 의미 있는 알고리즘 평가를 지원했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.